先说这个创业故事里最有戏剧性的部分:一位参与发明 RLHF 的人,现在创办了一家公司,公开宣称 RLHF 训练出来的 AI 形态是错的。

这家公司叫 TypeSafe AI(typesafe.ai),位于旧金山,非常早期——官网还是 “Version 0.01”,产品处于 waitlist 阶段,网上查不到任何融资信息。但创始团队的履历,可能是你今年能看到的最豪华配置之一。

CEO 是什么来头?

CEO Diogo Almeida,官网和公开演讲的介绍是:RLHF 与 InstructGPT 的共同发明人——对,就是让 GPT-3 变成 ChatGPT 的那套技术,现代大模型几乎都绕不开。他此前在 Google Brain,HN 上还有他上个月的演讲视频《What’s Next After RLHF?》(RLHF 之后是什么?)。

一位亲手把「AI 助手」这个形态推上王座的人,现在要超越它。这个叙事本身就值得一看。

两位联创也不弱:

  • COO Sasha Sheng:前 Meta/FAIR 研究工程师,做过 News Feed 和 AI 体验,NeurIPS/ECCV 有论文,2023 年赢过 7 个 hackathon;
  • CTO Erik Gafni:连续创业者(DNA 测序多模态 AI 公司 Ravel),两家独角兽(Invitae、Freenome)早期员工,专长是把 AI 做进生产系统。

先搞懂:现在的 AI 是怎么被「驯化」的?

要理解 TypeSafe 在反对什么,得先花一分钟搞懂主流大模型是怎么练出来的。

第一步,预训练(Pre-training)。 模型读遍互联网,学会「下一个词接什么」。这时候它只是个超强的文字接龙机器,你问「怎么退货」,它可能接着写出一篇退货攻略,也可能接着写出一首诗。

第二步,RLHF——人类反馈强化学习。 让人类标注员坐在模型旁边,同一个问题生成多个回答,人挑哪个好哪个坏,模型从中学「人类喜欢什么样的回答」。ChatGPT 的魔力就在这一步:它学会了礼貌、有条理、拒答有害问题。

直观对比一下:

没有 RLHF 的模型(问:我买的手机屏幕碎了怎么办?)

「屏幕碎裂的原因包括跌落、挤压、温度骤变等。常见的屏幕材质有 Gorilla Glass……」(它在补全「关于碎屏的文字」)

经过 RLHF 的模型(同样的问题)

「很抱歉听到您的手机屏幕碎了!😊 别担心,我们来一步步解决:第一步,建议您立即备份手机数据……」(它在回答「你这个人」)

第二步就是行业里说的「对齐(Alignment)」。TypeSafe 的全部故事,都建立在对这一步的反思上。

他们赌什么:AI 不该是对话框,该是数据库

TypeSafe 的 manifesto 叫《Composable AI: Build Prod, Not God》,核心论点三句话能说完:

第一,智能已经够用了,瓶颈不在智能本身。 他们不追 AGI 的移动靶,认为今天的模型早就跨过了「创造经济价值所需智能」的门槛。但砸了几万亿美元之后,大多数软件依然谈不上智能——说明问题不是模型不够聪明,而是智能太难被工程化地使用

第二,RLHF 把 AI 锁死在了「助手」形态。 这是最狠的自我否定:RLHF 优化的是「人类喜欢」,训出来的模型天然需要人来确认、来点击、来兜底。而软件从来不是这么工作的:再复杂的软件也是简单逻辑分层堆出来的,每个分支可审计。

第三,智能应该像数据库一样被调用。 如果一次「聪明的判断」能像一条数据库查询一样可靠、可组合,程序员就会像堆数据库一样往上堆它:代码负责精确计算,AI 负责常识分支。

主流路线 vs TypeSafe 路线:一张表看懂

维度 主流路线(OpenAI / Claude / 国产大模型) TypeSafe 路线
AI 的角色 助手:陪你聊天,帮你干活 组件:藏在软件里自动做决策
训练目标 RLHF:人类喜欢什么,就输出什么 RLCD:决策校准,知道该多自信
交互形态 对话框,人在环上确认 API 调用,无人值守运行
类比 一个聪明的实习生 一个可靠的函数
错误处理 说错了?人会看出来,重新问一次 必须像代码一样:极少出错、出错可查
商业模式 按订阅/按 token 卖智能 作为基础设施被分层依赖

再看一个具体例子。假设你在做一个电商系统,要判断一笔退款申请该不该通过:

主流助手形态 vs TypeSafe 组件形态对比

主流玩法(助手形态):

1
2
用户申请 → 系统调用 GPT → GPT 回复"我认为这笔退款
比较合理,建议通过" → 人工审核员看一眼 → 点确认

AI 给的是建议,人负责决定。一天 10 万笔申请,就需要一堆审核员——AI 只是把人力从「写判断」变成了「看判断」。

TypeSafe 想要的玩法(组件形态):

1
2
3
4
5
用户申请 → 系统调用 Jev("这笔退款该通过吗?")
← 返回一个可审计的判断:通过,置信度 96%,
依据是「物流记录确认未送达」
→ 系统直接执行,无人参与
→ 置信度 < 阈值的少数案例,才转人工

AI 是系统里的一个分支,像 if 语句一样被调用,像数据库一样被信任。人只处理 AI 自己都不确定的边角案例。

这两个架构的区别,就是「实习生」和「函数」的区别——前者你永远要盯着他,后者你敢把它埋进系统五层依赖之下。

产品:System One Model「Jev」

首款产品是一个新模型品类,他们叫 System One Model(取心理学里「系统一」——不假思索的直觉反应,对比「系统二」的刻意思考),名字叫 Jev,目前早期访问中。

9 月中的发布演示相当行为艺术:用这个模型玩《毁灭战士》(Doom)——不是聊天,不是写代码,而是在游戏环境里实时做「前进/开枪/躲开」的决策。选 Doom 做演示的潜台词很明显:这是 1993 年的软件,没有对话框、没有人类反馈,只有纯机器决策。

他们提出的差异化训练方法是 RLCD(reinforcement learning for calibrated decisions,面向校准决策的强化学习)。跟前两代对比:

  • RLHF:优化「人类喜欢」→ 学会讨好,但也学会啰嗦和自信地胡说
  • RLVR:优化「可程序化验证的任务」→ 学会刷榜,但只擅长有标准答案的题
  • RLCD:优化「决策校准度」→ 学会知道自己在什么场景该多确定,拿不准就明说

manifesto 里的安全观也很务实:安全是分层的前提。你只敢把可靠的组件埋进系统五层依赖之下——可检查、可测试、可逐层约束,别人才能在它上面继续盖楼。他们想要的终局是一套「智能原语生态」:像数据库和互联网协议一样,底座足够可靠,上层长出没人能自上而下设计的东西——Google 之于数据库,Stripe 之于网络协议。

「我们要造的是生产系统,不是神。」(We’re building prod, not God.)

怎么看:反主流叙事的豪赌

几个冷静的观察:

1. 方向极其非主流,但空白是真实的。 整个行业在卷 assistant 体验和 Agent 工作流时,TypeSafe 在赌「非助手型、可组合的机器决策模型」这个没人占的位置。钱都在往「更聪明的助手」里灌——Anthropic 刚签下 14.8GW 算力,OpenAI 重度用户日烧 7000 美元 token——没人给「更可靠的组件」定价。这既是机会,也可能是信号:这个位置没人占,也许只是因为需求还没被验证。

2. 「RLHF 发明人反 RLHF」有叙事张力,但要看兑现。 Jev 玩 Doom 的演示更像话题营销,真正要证明的是:这个模型在真实系统里做决策,误报率、可审计性、成本能不能打过「通用模型 + 工程封装」的笨办法。值得对照的是上周的 alibaba/open-code-review——它用「确定性工程 + Agent」的混合架构,把同样底层模型的审查质量做到了 token 消耗 1/9。这是「工程派」的答案:模型不够可靠,就用工程补。TypeSafe 是「模型派」:把可靠性直接训进模型里。两条路线谁赢,是未来两年最好看的战役之一。

3. 对开发者的现实意义。 短期内你不太会用上它的产品(waitlist 阶段、无定价、无 API 文档)。但这个方向值得放进你的技术雷达:如果「AI 作为可组合组件」成立,未来你的系统架构图里会出现一个新方块——不是「调用 GPT 的胶水代码」,而是一个跟 MySQL、Redis 并排的「判断服务」。

一句话总结:团队履历真顶级,方向真前卫,证据真少。等 Jev 的早期访问和第一笔融资消息——如果「RLHF 之父」都认为助手形态到头了,这件事本身就值得所有做 AI 产品的人想三分钟。


你觉得 AI 的终局形态是「人人对话的助手」,还是「沉入系统、无人察觉的组件」?评论区聊聊。

参考链接

  1. TypeSafe AI 官网
    https://typesafe.ai
  2. Manifesto: Composable AI — Build Prod, Not God
    https://typesafe.ai/manifesto
  3. 团队页
    https://typesafe.ai/team
  4. What’s Next After RLHF? — Diogo Almeida 演讲(YouTube)
    https://www.youtube.com/watch?v=cJ0EOzey--o
  5. The Register:TypeSafe AI debuts model for machines that plays Doom(2026-09-16)
    https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/