Jev 是 TypeSafe AI 于 2026 年 9 月 15 日推出的「System One(系统一)」决策模型——它不生成文本,而是对软件给出的状态与封闭问题,直接返回带校准概率的结构化判定(choice / score / noul)。发布两周内,GitHub 上围绕它生长出数百个开源项目。本文梳理 Jev 是什么、怎么工作、谁在用它,以及各热门项目的用途与选型建议。
传统大语言模型(GPT、Claude、Qwen 等)擅长开放式理解、长程推理与文本生成;Jev 走的是另一条路线。它面向 Agent 运行中最高频、边界最明确的一类需求——分类、选择、评分、真伪判断:给定一段状态(state:工单、日志、邮件、JSON、DOM 快照、文档片段……)和一组事先定义好的类型化问题,Jev 不做自回归文本生成,而是直接返回程序可以立即分支使用的答案与置信概率。
Jev 由前 OpenAI 研究员、曾参与 ChatGPT 研发的 Diogo Almeida 创办的 TypeSafe AI 发布,训练方法为 RLCD(Reinforcement Learning for Calibrated Decisions),目标是让模型报出的概率尽量接近真实正确率(校准,Calibration)。模型名字取自 19 世纪经济学家杰文斯(Jevons),暗合「杰文斯悖论」:智能使用成本的暴跌,将带来智能用量的暴涨。
| 类型 | 作用 | 典型场景 |
|---|---|---|
choice | 从给定选项中选出一个,返回每个选项的概率 | 工单路由、工具选择、点击哪个网页元素 |
score | 按有序量表打分,返回各档位概率 | 风险评级、内容质量分、优先级排序 |
noul | 判断一段陈述为真的可能性,返回 0–1 概率 | 「任务完成了吗」「这是垃圾邮件吗」式的二元/真伪判断 |
所有问题对着同一份 state 材料并行评估,一次 API 往返返回全部答案;延迟几乎不随问题数量线性爆炸。每个回答附带校准概率,开发者可以在代码里设阈值:置信度不足时自动转交人工或更大的模型处理——这是它比「让 LLM 输出 JSON」更可靠的工程原因(格式上不可能产生解析错误,也几乎不可能出现格式幻觉)。
业内把这种分工称为 Agent 架构的「快慢分工」:昂贵的大模型负责规划等「慢思考」,高频、原子化的「快判断」交给轻量决策模型;负责组装与调度这套分工的工程层被称为 Harness。Jev 社区项目的共同设计纪律是:写和想归大模型,判和选归 Jev,执行权留在确定性代码里(例如 Prism 刻意不让模型碰下单键,Canny 坚持「只有事实能否决」)。
发布后两周内,GitHub 上围绕 Jev 长出的生态项目已达 200+。最具参考价值的是社区维护的 Awesome JEV 目录(BeatAPI/awesome-jev,已被 HelloGitHub 等收录推荐):截至 2026-09-28 收录 228 个项目、10 大类别,所有仓库均有 50+ Stars 并附固定 commit 的源码证据;其中约 48 个达 1K+ Stars。早期整合文章统计的 28 个代表项目(8 个模型复刻 + 20 个应用)至今仍是最常被引用的入门清单。
| 类别 | 在做什么 | 代表项目 |
|---|---|---|
| 浏览器与电脑操作 | 把页面/屏幕的可交互元素编成候选动作表,Jev 每步选择动作与目标 | jev-ultrafast(browser-use)、Cua · JEV Use、fast-browser-use(APUS) |
| SDK 与框架集成 | 在主流框架里暴露 choice/score/noul 决策接口 | LangChain · TypeSafe、Vercel AI SDK、json-render(Vercel Labs) |
| 路由与优化 | 按任务难度/复杂度分流模型档位、压缩上下文 | LiteLLM · JEV Router、fast-jev-compaction、Winnow、jev-codex-router |
| Open Jev 开放模型 | 从不同技术路线复刻决策模型本身 | Laya、Kev、Nimble、SemIf、Von、Verdict、OpenJev、Simple Jev |
| 搜索与数据 | 语义检索、图遍历、训练数据筛选 | jegrep、neo4jev、jev-curate、Blink |
| 安全与审查 | 越狱/泄密检测、代码审查分诊、事实核查 | Agentgateway · JEV Guardrail、jev-review、jev-mcp、Canny |
| Agent 工作流 | MCP 工具箱、完成度核验、意图判断 | typesafe-mcp、jev-mcp、Canny、SemDecide |
| 界面与自动化 | 生成式 UI、表单填写、邮件分拣等终端应用 | json-render、Jev for Gmail、Jev Form Fill、TipTour |
| 开发者工具 | CLI、提示词转换、评测基准 | jeff-cli、llm-to-jev、judgekit、SemDecide |
| 垂直工具 | 游戏、无人机、量化交易、物联网等实时控制 | typesafe-mario、jev-drone、jev-trader、Prism、OneVOneJev |
browser-use 出品的标志性项目:把网页转成带编号的控件表,Jev 每步只回答「下一步做什么、点哪个元素」两件事;只有需要打字时才交给小生成模型。Google Flights 苏黎世→伦敦完整搜索约 7.1 秒、中位 Jev 延迟约 178ms,浏览器协议调用从一千多次降到约一百次。是「感知在代码、决策在模型」路线的代表作。
在 Python 工作流中原生暴露二值判断、分类、序数打分三类 Jev 决策节点。LangChain 还发布过小规模实验:让 Jev 与多个前沿大模型对固定 Agent 输出反复打分,Jev 每次调用约 0.44 秒、成本约 $0.00035,且连续打分一致性良好(官方也强调这仍是早期小规模测试)。
在请求进入后端模型之前,先用 Jev 对任务复杂度做分类,据此选择模型档位与推理深度——简单的改注释走便宜快档,架构/安全问题走强档。代表「决策模型做流量调度」的典型用法。
把 choice / score / yes-no 三类问题映射到统一的 evaluate 接口,前端与全栈开发者可以在既有 AI SDK 习惯里直接嵌入类型化决策。
在 Cua 的计算机使用 Agent 中,由 Jev 从 DOM 描述或视觉区域描述中选择动作 ID——把「下一步操作」收敛为封闭选项选择,降低每步调用的延迟与成本。
生成式 UI 框架:先定义组件白名单目录,模型只能在目录内组装界面。v0.21.0 加入实验性 Jev 组合器——Jev 不逐 token 生成 JSON,只在候选组件、属性、布局中做 Choice,代码把选择拼成合法 spec 再渲染,从机制上消灭非法 JSON。适合受不了模型写出非法 schema 的产品团队。
Claude Code 插件。官方 compaction 会「总结」旧对话、容易丢掉文件路径和报错原文;该插件把整段会话交给 Jev,对每条工具调用问「还需要吗」,无用的删除或截断、有用的原文保留。实测 18.8 万 token 压到 3.3 万,约 1.4 秒、压缩率 82%,失败后回退官方摘要。发布后迅速走红并衍生多个移植版。
在工具结果刚进上下文的那一刻做「垃圾回收」:大段 Read/Bash/Grep 输出切成约 25 行一块,Jev 判断「当前任务还需要吗」,确定无关的换成三行占位(全文本地缓存可回取),看起来像报错的一律不藏。原则:不确定就不能丢。适合被大文件和日志淹没上下文的 Agent 用户。
Go 单二进制 MCP 服务器:装好后 Claude Code、Claude Desktop、Codex、Pi 都能直接调 evaluate 工具,把 state + 类型化问题丢给 Jev 拿回概率答案。没有提示词要维护,一条命令完成注册——最适合刚拿到 API Key 的人先验证「Agent 会不会主动来问 Jev」。
把常见判断收成十个 MCP 工具:jev_verify(主张 vs 证据核对)、jev_screen(进上下文前筛不可信内容)、jev_find/rerank(语义查找与重排)、jev_review/gate(看 diff、核对「做完了」的声明)等。Agent 仍负责改文件跑命令,Jev 只给类型化判决,单次调用约 150–500ms。
分阶段审查流水线:风险矩阵(Noul)→ 文件画像(Choice+Score)→ 抽证据 → 机制分类 → 严重度打分 → 再决定要不要交给更贵的模型或人,结果在本机看板展开。强调「Jev 打分,人或 Agent 改代码」。被社区评价为「最值得抄」的审查类项目。适合 PR 太多、想先筛「周五能不能合」的团队。
挂在 Claude Code / Codex 的 hook 上,记一本只追加不改写的账本:改了哪些文件、跑过什么命令、退出码多少、测试过没有。Agent 宣称「完成」时先看账本有没有证据——没跑测试、没构建、刚改完就报完成,直接拦住。README 第一行写着设计原则:事实归代码,判断归 Jev,只有事实能否决。零运行时依赖。
Codex 每一轮(含工具续写)先由 Jev 判断任务难度,再自动选择模型档位、思考深度与速度模式。本地跑分类服务,接到 Codex Router 的 jev/auto provider。适合订阅里有多档模型、心疼每轮都开满推理的人。
被称为「意义版 grep、判断版 jq」:标准输入灌文本或 JSONL,输出谓词判断、路由、分数、过滤后的流和稳定的进程退出码。典型接法:爬虫结果先过相关性过滤、CI 里对 changelog/告警分类、数据管道按语义丢垃圾行。适合运维与数据工程师,不想为一次分类拉起完整 Agent。
把代码仓库当成要走的迷宫:多个 walker 从根目录出发,Jev 给文件夹和文件名打分(只读路径名不读全文),高分路径分到更多 walker,直到落到具体文件,输出每个文件收走多少 walker 的关注。适合大仓库冷启动时快速缩小范围,再让大模型精读。
jegrep:对活代码树做语义搜索、无需建索引。neo4jev(Neo4j 社区老兵 Michael Hunger):在知识图谱上边走边问——走到一个节点就把出边列成 Choice,由 Jev 概率分布决定下一条边,提供可解释的 GraphRAG 探索路径。jev-curate:Rust CLI + Python,流式筛选 JSONL/Parquet 训练数据(质量/相关性/风险量表),宣称每秒 1500+ 行,利用「输出 token 免费」的成本优势做海量语料过滤。
把模拟器 RAM 翻译成结构化 JSON(马里奥位置、敌人、地形、近期操作效果),Jev 在封闭动作集里每 8 帧做一次决策。教学意义极强:感知完全在代码里完成,模型只做选择——去掉视觉才能单独衡量决策质量。
MuJoCo 四旋翼仿真的「战术层」示范:几何控制器跑在控制频率上负责稳定与安全,Jev 以约 2.5Hz 看结构化态势,决定爬升、刹车、穿缝等上层动作;策略全部写成可调数值而非提示词长文。把「判断」与「控制」拆开,对机器人与自动驾驶很有参考价值(仿真演示,非真机适航)。
对照着看最有意思:jev-trader 让 Jev 在 Monad 约 300ms 的区块节奏里直接判断买/卖(模型延迟约 81ms),代码负责算中间价、库存与硬风控;Prism 则刻意保守——Jev 只判断 toxic flow、市场压力、均值回归等状态标签,执行仍走原有确定性策略,「亏钱的那一步保持确定性」。两者代表同一技术的两种风险态度。
APUS 基于公开文档独立复现了 Jev 的核心逻辑(跳过自回归解码、隐状态直接打分、KV-Cache 广播与并发批量评估),封装为开箱即用的本地 Agent Skill:可见交互元素编成编号候选,由本地 Qwen3.5 单次前向完成「点哪里」的决策,从机制上消除选择器幻觉,MIT 协议、纯本地离线。RSI-Jev(哈佛研究员)则更进一步:让 AI Agent 自动提出类 Jev 模型的改进方案、跑实验、评估并迭代(已迭代至 v3.0、累计 204 个实验分支),在记忆重排序任务上把 R@1 从 0.192 提升到 0.308。
| 项目 | 路线 | 特点与自测数据 | 适合谁 |
|---|---|---|---|
| SemIf TheoLeeCJ |
冻结现成大模型,读选项位置 logits | 不解码任何 token,一次前向取固定选项分数做 softmax。Qwen3.5-4B,RTX 3090 上 21 个二元判断约 1.02 秒(生成同等 JSON 需 5.3 秒),102 行对齐子集一致率约 84.5%(Jev 公布 88.3%)。概率未经校准。MIT。 | 想当天跑通、门槛最低(3090 / Apple Silicon / WebGPU 均可) |
| Simple Jev featherless |
共享前缀只读一次(KV cache 复用) | 公共说明 + state 算成共享前缀,每个问题只跑自己的后缀再读允许标签的 logits,由服务器拼 JSON。作者明确声明:复刻的是接口和用法,不代表准确率与校准已达 Jev 水平。提供本地 HF/PyTorch 服务与在线演示 API。 | 想把工单路由、情绪分级先跑起来的团队 |
| Laya Convai Innovations |
专用小型分类器结构 | 几亿参数:ModernBERT/mmBERT 编码 state 与选项 + 决策头。速度是名片:T4 上单问题 p50 约 32.8ms,比 Jev 公布值快 7–8 倍。短板:Banking77 意图分类仅 42.5%(Jev 87.0%),选项一多就被挤爆。Apache 2.0,完全本地。 | 选项不多、要极低延迟、要离线的场景(⭐ 17.1K) |
| Von wfzyx |
从头训练的专用决策模型 | 约 395M,双向编码器 + Option-Marker 并行选项注意力,单次前向同时处理 Choice/Noul/Score;本地 GPU / Apple MPS 单次十几到二十毫秒。自测 49 任务宏准确率约 71.5%,与闭源 Jev 有可见落差。定位为本地替代:工单分流、内容审核、亚 20ms 闭环控制。 | 要极小模型、可本地、延迟敏感的控制类任务 |
| Verdict Heman10x |
专打校准与顺序稳健性 | 约 150M,ModernBERT-base 双头:一个输出选项分布、一个单独输出置信度;训练加入 Symmetric Permutation-KL(打乱选项顺序惩罚分布不一致)。2000 条留出决策:准确率 77.10%、Brier 0.0636、置信度头 ECE 0.0144。GTX 1660 Ti 训练约 8.8 小时。 | 最在意「虚高置信度」和「换序变卦」问题的人——复刻派里最对题的一个 |
| Kev Jared Palmer |
改造现有大模型(Qwen3.5) | 共享前缀只读一次,问题间用块因果掩码隔离;API 刻意对齐官方 System One,官方 SDK 改 base URL 即可指向本地。公开 0.8B / 4B / 9B。Kev-9B 外部测试集约 83.7%(Jev 约 85.7%),Brier 差距在收窄。Apache-2.0。 | 愿意微调、又想留住 Qwen 世界知识的人——最接近「开源版 Jev 配方」 |
| Nimble Bespoke Labs |
训练把 Qwen 练成决策模型 | 更像可复现的训练论文:Qwen3.5-9B 底座,LoRA 只训答案 token;数据配方是构造几乎相同、只改一个事实让答案翻转的两段材料,逼模型学「哪一句在决定答案」。324 条留出样本匹配率 90.12%,超过未微调 27B(84.88%),距 Jev 的 93.21% 约 3 个点;样本偏窄、概率未完全校准。 | 想做垂直领域「小 Jev」的团队——对比翻转的数据配方比堆分类样本更值得抄 |
| OpenJev razorback16 |
扩散模型一次填多个答案槽 | 最不一样的一条:不按 token 生成,对整块「画布」去噪,一次填多个答案槽,没有 JSON 解析、格式上不可能写出 schema 以外的东西。NVIDIA 量化 DiffusionGemma 26B-A4B,RTX PRO 6000 上每请求 3 个问题并发 1 时 p50/p95 约 94ms。限制:choice 最多 128 选项(Jev 为 255),显存门槛约 24GB。 | 愿意折腾扩散生成物理的实验者——「换一种生成物理」的路线 |