研究报告 · AI Agent 生态

Jev 生态全景:System One 决策模型与围绕它的热门开源项目

Jev 是 TypeSafe AI 于 2026 年 9 月 15 日推出的「System One(系统一)」决策模型——它不生成文本,而是对软件给出的状态与封闭问题,直接返回带校准概率的结构化判定(choice / score / noul)。发布两周内,GitHub 上围绕它生长出数百个开源项目。本文梳理 Jev 是什么、怎么工作、谁在用它,以及各热门项目的用途与选型建议。

📅 整理日期:2026 年 10 月 8 日 📊 生态规模:Awesome Jev 目录收录 228 个项目 / 10 大类别 🔖 模型发布:TypeSafe AI,2026-09-15

一、Jev 是什么:先建立全面认识

70–500ms
单个问题的响应延迟
≈200×
分类决策任务上相对前沿大模型的最高提速(官方口径)
≈1/400
官方宣称的成本下限(输出 token 免费,输入约 $0.042/M)

1. 定位:与聊天模型互补的「决策模型」

传统大语言模型(GPT、Claude、Qwen 等)擅长开放式理解、长程推理与文本生成;Jev 走的是另一条路线。它面向 Agent 运行中最高频、边界最明确的一类需求——分类、选择、评分、真伪判断:给定一段状态(state:工单、日志、邮件、JSON、DOM 快照、文档片段……)和一组事先定义好的类型化问题,Jev 不做自回归文本生成,而是直接返回程序可以立即分支使用的答案与置信概率。

Jev 由前 OpenAI 研究员、曾参与 ChatGPT 研发的 Diogo Almeida 创办的 TypeSafe AI 发布,训练方法为 RLCD(Reinforcement Learning for Calibrated Decisions),目标是让模型报出的概率尽量接近真实正确率(校准,Calibration)。模型名字取自 19 世纪经济学家杰文斯(Jevons),暗合「杰文斯悖论」:智能使用成本的暴跌,将带来智能用量的暴涨。

2. 三种类型化问题:Choice / Score / Noul

类型作用典型场景
choice从给定选项中选出一个,返回每个选项的概率工单路由、工具选择、点击哪个网页元素
score按有序量表打分,返回各档位概率风险评级、内容质量分、优先级排序
noul判断一段陈述为真的可能性,返回 0–1 概率「任务完成了吗」「这是垃圾邮件吗」式的二元/真伪判断

所有问题对着同一份 state 材料并行评估,一次 API 往返返回全部答案;延迟几乎不随问题数量线性爆炸。每个回答附带校准概率,开发者可以在代码里设阈值:置信度不足时自动转交人工或更大的模型处理——这是它比「让 LLM 输出 JSON」更可靠的工程原因(格式上不可能产生解析错误,也几乎不可能出现格式幻觉)。

3. 工作机制:「快慢分工」的 Harness 架构

感知:代码把状态整理成结构化输入 → Jev:在封闭选项里给概率(快思考) → 程序:按阈值分支,决定执行 → 大模型:规划、写作等慢思考(按需)

业内把这种分工称为 Agent 架构的「快慢分工」:昂贵的大模型负责规划等「慢思考」,高频、原子化的「快判断」交给轻量决策模型;负责组装与调度这套分工的工程层被称为 Harness。Jev 社区项目的共同设计纪律是:写和想归大模型,判和选归 Jev,执行权留在确定性代码里(例如 Prism 刻意不让模型碰下单键,Canny 坚持「只有事实能否决」)。

⚠️ 重要事实澄清 Jev 模型本身是闭源的托管服务:截至 2026 年 9 月下旬,没有公开的权重或训练代码发布;TypeSafe 以宽松许可公开的是官方 Python / JavaScript SDK 和一个 Agent Skill。社区里的「Open Jev」项目复刻的是接口形态(状态 + 类型化问题 + 概率输出),而非模型本身——它们的权重、训练数据与概率校准均与官方 Jev 不等价。另外官方宣称的「193.6× 提速、444.6× 成本优势」来自 TypeSafe 自家准备的测试集,宜作为方向性参考而非基准结论。

二、生态总览:规模、类别与代表项目

发布后两周内,GitHub 上围绕 Jev 长出的生态项目已达 200+。最具参考价值的是社区维护的 Awesome JEV 目录(BeatAPI/awesome-jev,已被 HelloGitHub 等收录推荐):截至 2026-09-28 收录 228 个项目、10 大类别,所有仓库均有 50+ Stars 并附固定 commit 的源码证据;其中约 48 个达 1K+ Stars。早期整合文章统计的 28 个代表项目(8 个模型复刻 + 20 个应用)至今仍是最常被引用的入门清单。

类别在做什么代表项目
浏览器与电脑操作把页面/屏幕的可交互元素编成候选动作表,Jev 每步选择动作与目标jev-ultrafast(browser-use)、Cua · JEV Use、fast-browser-use(APUS)
SDK 与框架集成在主流框架里暴露 choice/score/noul 决策接口LangChain · TypeSafe、Vercel AI SDK、json-render(Vercel Labs)
路由与优化按任务难度/复杂度分流模型档位、压缩上下文LiteLLM · JEV Router、fast-jev-compaction、Winnow、jev-codex-router
Open Jev 开放模型从不同技术路线复刻决策模型本身Laya、Kev、Nimble、SemIf、Von、Verdict、OpenJev、Simple Jev
搜索与数据语义检索、图遍历、训练数据筛选jegrep、neo4jev、jev-curate、Blink
安全与审查越狱/泄密检测、代码审查分诊、事实核查Agentgateway · JEV Guardrail、jev-review、jev-mcp、Canny
Agent 工作流MCP 工具箱、完成度核验、意图判断typesafe-mcp、jev-mcp、Canny、SemDecide
界面与自动化生成式 UI、表单填写、邮件分拣等终端应用json-render、Jev for Gmail、Jev Form Fill、TipTour
开发者工具CLI、提示词转换、评测基准jeff-cli、llm-to-jev、judgekit、SemDecide
垂直工具游戏、无人机、量化交易、物联网等实时控制typesafe-mario、jev-drone、jev-trader、Prism、OneVOneJev

三、热门应用项目:都有什么用

🔥 头部项目(万星生态中的核心)

jev-ultrafast浏览器操作⭐ 20K

github.com/browser-use / jev-ultrafast

browser-use 出品的标志性项目:把网页转成带编号的控件表,Jev 每步只回答「下一步做什么、点哪个元素」两件事;只有需要打字时才交给小生成模型。Google Flights 苏黎世→伦敦完整搜索约 7.1 秒、中位 Jev 延迟约 178ms,浏览器协议调用从一千多次降到约一百次。是「感知在代码、决策在模型」路线的代表作。

LangChain · TypeSafe 集成SDK 集成⭐ 146.9K

LangChain 官方集成

在 Python 工作流中原生暴露二值判断、分类、序数打分三类 Jev 决策节点。LangChain 还发布过小规模实验:让 Jev 与多个前沿大模型对固定 Agent 输出反复打分,Jev 每次调用约 0.44 秒、成本约 $0.00035,且连续打分一致性良好(官方也强调这仍是早期小规模测试)。

LiteLLM · JEV Router路由优化⭐ 59.4K

LiteLLM 集成

在请求进入后端模型之前,先用 Jev 对任务复杂度做分类,据此选择模型档位与推理深度——简单的改注释走便宜快档,架构/安全问题走强档。代表「决策模型做流量调度」的典型用法。

Vercel AI SDK · TypeSafeSDK 集成⭐ 26.9K

Vercel AI SDK 集成

把 choice / score / yes-no 三类问题映射到统一的 evaluate 接口,前端与全栈开发者可以在既有 AI SDK 习惯里直接嵌入类型化决策。

Cua · JEV Use电脑操作⭐ 26.0K

trycua / cua

在 Cua 的计算机使用 Agent 中,由 Jev 从 DOM 描述或视觉区域描述中选择动作 ID——把「下一步操作」收敛为封闭选项选择,降低每步调用的延迟与成本。

json-render(Vercel Labs)生成式 UI

github.com/vercel-labs / json-render

生成式 UI 框架:先定义组件白名单目录,模型只能在目录内组装界面。v0.21.0 加入实验性 Jev 组合器——Jev 不逐 token 生成 JSON,只在候选组件、属性、布局中做 Choice,代码把选择拼成合法 spec 再渲染,从机制上消灭非法 JSON。适合受不了模型写出非法 schema 的产品团队。

🛠 Agent 基建与工作流

fast-jev-compaction上下文压缩

github.com/tamaratran / fast-jev-compaction

Claude Code 插件。官方 compaction 会「总结」旧对话、容易丢掉文件路径和报错原文;该插件把整段会话交给 Jev,对每条工具调用问「还需要吗」,无用的删除或截断、有用的原文保留。实测 18.8 万 token 压到 3.3 万,约 1.4 秒、压缩率 82%,失败后回退官方摘要。发布后迅速走红并衍生多个移植版。

Winnow上下文治理

github.com/GhalebDweik / Winnow

在工具结果刚进上下文的那一刻做「垃圾回收」:大段 Read/Bash/Grep 输出切成约 25 行一块,Jev 判断「当前任务还需要吗」,确定无关的换成三行占位(全文本地缓存可回取),看起来像报错的一律不藏。原则:不确定就不能丢。适合被大文件和日志淹没上下文的 Agent 用户。

typesafe-mcpMCP 接入

github.com/itsmostafa / typesafe-mcp

Go 单二进制 MCP 服务器:装好后 Claude Code、Claude Desktop、Codex、Pi 都能直接调 evaluate 工具,把 state + 类型化问题丢给 Jev 拿回概率答案。没有提示词要维护,一条命令完成注册——最适合刚拿到 API Key 的人先验证「Agent 会不会主动来问 Jev」。

jev-mcp判断工具箱

github.com/jkudish / jev-mcp

把常见判断收成十个 MCP 工具:jev_verify(主张 vs 证据核对)、jev_screen(进上下文前筛不可信内容)、jev_find/rerank(语义查找与重排)、jev_review/gate(看 diff、核对「做完了」的声明)等。Agent 仍负责改文件跑命令,Jev 只给类型化判决,单次调用约 150–500ms。

jev-review代码审查

github.com/devagrawal0 / jev-review

分阶段审查流水线:风险矩阵(Noul)→ 文件画像(Choice+Score)→ 抽证据 → 机制分类 → 严重度打分 → 再决定要不要交给更贵的模型或人,结果在本机看板展开。强调「Jev 打分,人或 Agent 改代码」。被社区评价为「最值得抄」的审查类项目。适合 PR 太多、想先筛「周五能不能合」的团队。

Canny完成度核验

github.com/qkal / Canny

挂在 Claude Code / Codex 的 hook 上,记一本只追加不改写的账本:改了哪些文件、跑过什么命令、退出码多少、测试过没有。Agent 宣称「完成」时先看账本有没有证据——没跑测试、没构建、刚改完就报完成,直接拦住。README 第一行写着设计原则:事实归代码,判断归 Jev,只有事实能否决。零运行时依赖。

jev-codex-router模型路由

github.com/0xNatoshi / jev-codex-router

Codex 每一轮(含工具续写)先由 Jev 判断任务难度,再自动选择模型档位、思考深度与速度模式。本地跑分类服务,接到 Codex Router 的 jev/auto provider。适合订阅里有多档模型、心疼每轮都开满推理的人。

SemDecide语义 CLI

github.com/sharziki / semdecide

被称为「意义版 grep、判断版 jq」:标准输入灌文本或 JSONL,输出谓词判断、路由、分数、过滤后的流和稳定的进程退出码。典型接法:爬虫结果先过相关性过滤、CI 里对 changelog/告警分类、数据管道按语义丢垃圾行。适合运维与数据工程师,不想为一次分类拉起完整 Agent。

Blink语义搜索

github.com/ellipsis-dev / Blink

把代码仓库当成要走的迷宫:多个 walker 从根目录出发,Jev 给文件夹和文件名打分(只读路径名不读全文),高分路径分到更多 walker,直到落到具体文件,输出每个文件收走多少 walker 的关注。适合大仓库冷启动时快速缩小范围,再让大模型精读。

jegrep / neo4jev / jev-curate数据与检索

多个仓库

jegrep:对活代码树做语义搜索、无需建索引。neo4jev(Neo4j 社区老兵 Michael Hunger):在知识图谱上边走边问——走到一个节点就把出边列成 Choice,由 Jev 概率分布决定下一条边,提供可解释的 GraphRAG 探索路径。jev-curate:Rust CLI + Python,流式筛选 JSONL/Parquet 训练数据(质量/相关性/风险量表),宣称每秒 1500+ 行,利用「输出 token 免费」的成本优势做海量语料过滤。

🎮 实时控制与垂直应用

typesafe-mario游戏控制

github.com/fhshaik / typesafe-mario

把模拟器 RAM 翻译成结构化 JSON(马里奥位置、敌人、地形、近期操作效果),Jev 在封闭动作集里每 8 帧做一次决策。教学意义极强:感知完全在代码里完成,模型只做选择——去掉视觉才能单独衡量决策质量。

jev-drone机器人/无人机

github.com/RomanSlack / jev-drone

MuJoCo 四旋翼仿真的「战术层」示范:几何控制器跑在控制频率上负责稳定与安全,Jev 以约 2.5Hz 看结构化态势,决定爬升、刹车、穿缝等上层动作;策略全部写成可调数值而非提示词长文。把「判断」与「控制」拆开,对机器人与自动驾驶很有参考价值(仿真演示,非真机适航)。

jev-trader / Prism量化交易

github.com/jarrodwatts / jev-trader

对照着看最有意思:jev-trader 让 Jev 在 Monad 约 300ms 的区块节奏里直接判断买/卖(模型延迟约 81ms),代码负责算中间价、库存与硬风控;Prism 则刻意保守——Jev 只判断 toxic flow、市场压力、均值回归等状态标签,执行仍走原有确定性策略,「亏钱的那一步保持确定性」。两者代表同一技术的两种风险态度。

APUS fast-browser-use / RSI-Jev复现研究

APUS-AI-Lab / fast-browser-use;RSI-Jev

APUS 基于公开文档独立复现了 Jev 的核心逻辑(跳过自回归解码、隐状态直接打分、KV-Cache 广播与并发批量评估),封装为开箱即用的本地 Agent Skill:可见交互元素编成编号候选,由本地 Qwen3.5 单次前向完成「点哪里」的决策,从机制上消除选择器幻觉,MIT 协议、纯本地离线。RSI-Jev(哈佛研究员)则更进一步:让 AI Agent 自动提出类 Jev 模型的改进方案、跑实验、评估并迭代(已迭代至 v3.0、累计 204 个实验分支),在记忆重排序任务上把 R@1 从 0.192 提升到 0.308。

四、Open Jev:复刻决策模型的八条技术路线

为什么有这么多复刻? Jev 是托管闭源服务,且未向中国大陆开放。社区「Open Jev」阵营的目标是从不同技术路线复刻「状态 + 类型化问题 + 概率输出」这一接口形态,换取本地部署、离线运行和数据不出域。注意:各项目自测数字来自不同题集,复刻的是接口而非决策质量,概率校准普遍未达到 Jev 水平,生产使用前必须用自有业务数据验证。
项目路线特点与自测数据适合谁
SemIf
TheoLeeCJ
冻结现成大模型,读选项位置 logits 不解码任何 token,一次前向取固定选项分数做 softmax。Qwen3.5-4B,RTX 3090 上 21 个二元判断约 1.02 秒(生成同等 JSON 需 5.3 秒),102 行对齐子集一致率约 84.5%(Jev 公布 88.3%)。概率未经校准。MIT。 想当天跑通、门槛最低(3090 / Apple Silicon / WebGPU 均可)
Simple Jev
featherless
共享前缀只读一次(KV cache 复用) 公共说明 + state 算成共享前缀,每个问题只跑自己的后缀再读允许标签的 logits,由服务器拼 JSON。作者明确声明:复刻的是接口和用法,不代表准确率与校准已达 Jev 水平。提供本地 HF/PyTorch 服务与在线演示 API。 想把工单路由、情绪分级先跑起来的团队
Laya
Convai Innovations
专用小型分类器结构 几亿参数:ModernBERT/mmBERT 编码 state 与选项 + 决策头。速度是名片:T4 上单问题 p50 约 32.8ms,比 Jev 公布值快 7–8 倍。短板:Banking77 意图分类仅 42.5%(Jev 87.0%),选项一多就被挤爆。Apache 2.0,完全本地。 选项不多、要极低延迟、要离线的场景(⭐ 17.1K)
Von
wfzyx
从头训练的专用决策模型 约 395M,双向编码器 + Option-Marker 并行选项注意力,单次前向同时处理 Choice/Noul/Score;本地 GPU / Apple MPS 单次十几到二十毫秒。自测 49 任务宏准确率约 71.5%,与闭源 Jev 有可见落差。定位为本地替代:工单分流、内容审核、亚 20ms 闭环控制。 要极小模型、可本地、延迟敏感的控制类任务
Verdict
Heman10x
专打校准与顺序稳健性 约 150M,ModernBERT-base 双头:一个输出选项分布、一个单独输出置信度;训练加入 Symmetric Permutation-KL(打乱选项顺序惩罚分布不一致)。2000 条留出决策:准确率 77.10%、Brier 0.0636、置信度头 ECE 0.0144。GTX 1660 Ti 训练约 8.8 小时。 最在意「虚高置信度」和「换序变卦」问题的人——复刻派里最对题的一个
Kev
Jared Palmer
改造现有大模型(Qwen3.5) 共享前缀只读一次,问题间用块因果掩码隔离;API 刻意对齐官方 System One,官方 SDK 改 base URL 即可指向本地。公开 0.8B / 4B / 9B。Kev-9B 外部测试集约 83.7%(Jev 约 85.7%),Brier 差距在收窄。Apache-2.0。 愿意微调、又想留住 Qwen 世界知识的人——最接近「开源版 Jev 配方」
Nimble
Bespoke Labs
训练把 Qwen 练成决策模型 更像可复现的训练论文:Qwen3.5-9B 底座,LoRA 只训答案 token;数据配方是构造几乎相同、只改一个事实让答案翻转的两段材料,逼模型学「哪一句在决定答案」。324 条留出样本匹配率 90.12%,超过未微调 27B(84.88%),距 Jev 的 93.21% 约 3 个点;样本偏窄、概率未完全校准。 想做垂直领域「小 Jev」的团队——对比翻转的数据配方比堆分类样本更值得抄
OpenJev
razorback16
扩散模型一次填多个答案槽 最不一样的一条:不按 token 生成,对整块「画布」去噪,一次填多个答案槽,没有 JSON 解析、格式上不可能写出 schema 以外的东西。NVIDIA 量化 DiffusionGemma 26B-A4B,RTX PRO 6000 上每请求 3 个问题并发 1 时 p50/p95 约 94ms。限制:choice 最多 128 选项(Jev 为 255),显存门槛约 24GB。 愿意折腾扩散生成物理的实验者——「换一种生成物理」的路线

五、选型建议与上手路径

按需求选项目

  • 网页/桌面自动化:jev-ultrafast(云端 API、最快上手)、APUS fast-browser-use(纯本地、无 GPU 也可)
  • 上下文治理:Winnow(工具输出进上下文前过滤)、fast-jev-compaction(会话压缩)
  • 代码审查:jev-review(本地看板分阶段审查)
  • 给 Agent 加判断层:typesafe-mcp(快速接入)→ jev-mcp(十个判断工具)
  • 训练数据筛选:jev-curate(Rust 高吞吐流水线)
  • 本地/离线部署:Simple Jev(服务化)、Laya/Von(极小模型低延迟)、Kev/Nimble(可微调的 Qwen 路线)
  • 最在意概率校准:Verdict

推荐的上手顺序

  1. 先装 typesafe-mcp:一条命令注册,验证「Agent 会不会主动来问 Jev」这个最小闭环。
  2. 按场景挑一个单点工具:上下文乱选 Winnow,做网页 Agent 选 jev-ultrafast,筛数据选 jev-curate。
  3. 有合规/离线需求再评估 Open Jev:用自有业务数据做分桶校准验证,不要直接采信各仓库自测数字。
  4. 确立设计纪律:写和想归大模型,判和选归 Jev,执行权与事实核验留在确定性代码里。
✅ 三条值得记住的规律 ① 所有成功项目的共同点:模型只负责在封闭选项里给概率,程序自己决定怎么分支,执行权留在代码里(Prism 不碰下单键、Canny 只有事实能否决、jev-review 强调 Jev 打分人改代码)。② 复刻派证明「接口形态」可以当天复刻,但不证明「决策质量」已经齐平——概率校准是核心壁垒。③ 「封闭选项 + 概率输出」这个接口形态本身比任何单一模型都更值得投资:模型会迭代,接口可以先在自己的系统里试起来。
⚠️ 风险与注意事项 ① Jev 服务未向中国大陆开放,接入需考虑网络与合规;② 生态极度年轻(2026-09 中才发布),多数项目没有正式版本、提交数少,社区评估直言「没有一个能上生产,建议读它们而不是上线它们」;③ 官方性能数字来自自家测试集;④ 复刻项目之间准确率不可横向比较(题集不同);⑤ 浏览器/桌面自动化项目的共同盲区:无障碍树残缺、自定义绘制控件、验证码会让判断层「失明」。