Interview Digest · 2026-09

Diogo Almeida 访谈核心观点

Jev 发布数天后,TypeSafe 联合创始人兼 CEO 做客 Latent Space 播客(swyx 主持,2h20m,2026-09-21)。以下 9 张卡片提炼自该访谈,并以 AI Council 2026 演讲与中文媒体全文整理作为补充。

Diogo Almeida 人物档案 01 Diogo Almeida:从 ChatGPT 到机器原生 AI 离开 OpenAI 后,他花两年多回答一个问题:足够聪明的 AI,为何进不了真实工作流? OpenAI · 4.5 年 指令跟随模型团队 创办 TypeSafe 离开后寻找新答案 2026.05 AI Council 演讲 2026.09.15 Jev 发布 · $40M InstructGPT 与 GPT-4 技术报告共同作者,参与了 ChatGPT 背后的 RLHF 研究 TypeSafe 自我定位:数据实验室(data lab),而非模型实验室 "AI 可以远比人们此前设想的更强大。" — AI can be so much more.
01 · 人物档案 — 来源:Latent Space 播客(2026-09-21)
超强引擎,却没有合适的插头 02 超强引擎,却没有合适的插头 AI 能解决千禧年难题级别的数学,却自动化不了大量基础工作。 AI 引擎 能解极难的数学问题 真实工作流 有经济价值的自动化任务 接入失败 偶尔拒答 · 输出漂移 · 行为不可预测 —— 任何一条都足以让整个系统失效 辅助工作(回答人类)近乎超人;自动化工作(真正执行)却频频掉链子 现有 AI 是一台超强的自动化引擎,却没有合适的插头,接不到真正有经济价值的工作上。
02 · 核心矛盾:能力 ≠ 可靠性 — 来源:Latent Space 播客 / AI Council 2026
System One 模型:让代码成为消费者 03 System One 模型:让代码成为消费者 既有三类模型 —— 输出的终点是人类的眼睛 预训练 LLM 互联网文本的自动补全 RLHF 模型 聊天与指令遵循 RLVR 模型 尴尬的灰色地带 共同点:输出面向人类 → 停留在对话框里,进不了软件内部 System One 模型(Jev)—— 输出的终点是代码 Jev 可编程模型 带概率的类型化决策 输出可被程序验证与消费 软件控制流 代码直接消费 让代码,而非人类,成为模型输出的消费者。
03 · System One 模型的定义 — 来源:Latent Space 播客
RLHF 的隐藏代价:模式丢弃偷走校准 04 RLHF 的隐藏代价:模式丢弃偷走校准 校准良好的模型 诚实覆盖整个分布(含尾部) RLHF 模型:模式丢弃 丢掉少数、不常见的模式 为了长串输出不出错 → 极度保守:明显错误易被发现,微妙错误却难以察觉 被校准掉的"诚实",正是字符串输出模型不适合做决策的根源 偶尔拒答、输出漂移、不可预测 —— 可靠性,才是 AI 进入生产环境的最大缺口。
04 · RLHF 的隐藏代价:mode collapse 破坏校准 — 来源:Latent Space 播客
LeCun 的饼图:结论没错,前提错了 05 LeCun 的饼图:结论没错,前提错了 输出越长,出错概率 → 1 流传甚广的"LLM 注定失败"幻灯片 数学上:成立 —— 误差随序列长度累积 前提:模型诚实校准、覆盖完整分布 经验上:错误 —— 实际表现远好于预测 RLHF 模型靠极度保守规避显性错误,并不诚实 不是数学错了,是对模型行为的假设错了 杨立昆的很多论断,反而是这个领域里最接近事实的一批 —— 但这张图的解释错了。
05 · 重新解读 Yann LeCun 的" doomed-LLM"论断 — 来源:Latent Space 播客
唯一的北极星:每美元智能 06 唯一的北极星:每美元智能 Jev 之名取自 Jevons 悖论:核心指标不是跑分,而是一美元能换来多少可用的智能。 他公开反对的 公开基准测试 花 10 亿美元从头预训练 单一维度的能力竞赛 他坚持的取舍 可靠性、成本、校准、速度的平衡 TypeSafe = 数据实验室 选对任务与数据 > 盲目堆算力 "最苦的一课"(the bitterest lesson 的补充版):选对任务与数据,胜过单纯堆算力。 We are doing absolutely disgusting things to be on the Pareto curve of intelligence per dollar.
06 · 每美元智能(Intelligence per Dollar)— 来源:Latent Space 播客
把智能装进程序:小决策取代大提示词 07 把智能装进程序:小决策取代大提示词 过去的方式 巨型 Prompt + System Message 单次大模型调用 输出难以测量 一次拒答 = 全盘失败 Jev 的方式 程序掌握工作流 拆成许多小而可测的决策 结构化状态取代巨型提示词 拒答 = 可处理的控制流故障 AI 消失进软件后台、默认有用;Inverse SaaS-pocalypse:AI 增强现有软件,而非取代它。 "智能会更像一个数据库,而不是一位同事。" — more like a database than a coworker
07 · 编程原语与工作流设计 — 来源:Latent Space 播客
编码智能体:超越 KV 缓存 08 编码智能体:超越 KV 缓存 他的后续发文"The Tyranny of the KV Cache":KV 缓存正在决定智能体的架构,而不是架构服务于任务。 现状:单模型架构的弊端 过度依赖单一模型 任务分解薄弱 状态管理糟糕 子智能体协同低效 未来:多智能体协同 智能地共享状态 低成本查询历史 分层任务树 锁与只读进程协同 "Cache Rules Everything" —— 这不是产品公告,而是机器原生 AI 基础设施的宣言。
08 · 编码智能体的下一个十年 — 来源:Latent Space 播客 +《The Tyranny of the KV Cache》
把开发者放在 VIP 投资人前面 09 把开发者放在 VIP 投资人前面 10 万+ Discord 一夜涌入 3800 万 发布视频播放量 3 个 话题同时上榜 $40M DCVC 领投 发布周最忙的时候,他把社区 Town Hall 排在一堆重要投资人的会议前面 —— 他自己形容这个决定"有点脏",因为真正想优先照顾的是写代码的人。 他说发布像一次证明:"前 Jev 世界"是一场悲剧 —— 潜力巨大,实用不足。 "Never been worse." —— 被问及"现在感觉如何"时的夸张式自嘲
09 · 发布周与社区 — 来源:Latent Space 播客 / 腾讯科技中文专访