RLHF 联合发明人出走创业:他不做 ChatGPT 的接班人,要做「AI 的数据库」
先说这个创业故事里最有戏剧性的部分:一位参与发明 RLHF 的人,现在创办了一家公司,公开宣称 RLHF 训练出来的 AI 形态是错的。
这家公司叫 TypeSafe AI(typesafe.ai),位于旧金山,非常早期——官网还是 “Version 0.01”,产品处于 waitlist 阶段,网上查不到任何融资信息。但创始团队的履历,可能是你今年能看到的最豪华配置之一。
CEO 是什么来头?
CEO Diogo Almeida,官网和公开演讲的介绍是:RLHF 与 InstructGPT 的共同发明人——对,就是让 GPT-3 变成 ChatGPT 的那套技术,现代大模型几乎都绕不开。他此前在 Google Brain,HN 上还有他上个月的演讲视频《What’s Next After RLHF?》(RLHF 之后是什么?)。
一位亲手把「AI 助手」这个形态推上王座的人,现在要超越它。这个叙事本身就值得一看。
两位联创也不弱:
- COO Sasha Sheng:前 Meta/FAIR 研究工程师,做过 News Feed 和 AI 体验,NeurIPS/ECCV 有论文,2023 年赢过 7 个 hackathon;
- CTO Erik Gafni:连续创业者(DNA 测序多模态 AI 公司 Ravel),两家独角兽(Invitae、Freenome)早期员工,专长是把 AI 做进生产系统。
先搞懂:现在的 AI 是怎么被「驯化」的?
要理解 TypeSafe 在反对什么,得先花一分钟搞懂主流大模型是怎么练出来的。
第一步,预训练(Pre-training)。 模型读遍互联网,学会「下一个词接什么」。这时候它只是个超强的文字接龙机器,你问「怎么退货」,它可能接着写出一篇退货攻略,也可能接着写出一首诗。
第二步,RLHF——人类反馈强化学习。 让人类标注员坐在模型旁边,同一个问题生成多个回答,人挑哪个好哪个坏,模型从中学「人类喜欢什么样的回答」。ChatGPT 的魔力就在这一步:它学会了礼貌、有条理、拒答有害问题。
直观对比一下:
没有 RLHF 的模型(问:我买的手机屏幕碎了怎么办?)
「屏幕碎裂的原因包括跌落、挤压、温度骤变等。常见的屏幕材质有 Gorilla Glass……」(它在补全「关于碎屏的文字」)
经过 RLHF 的模型(同样的问题)
「很抱歉听到您的手机屏幕碎了!😊 别担心,我们来一步步解决:第一步,建议您立即备份手机数据……」(它在回答「你这个人」)
第二步就是行业里说的「对齐(Alignment)」。TypeSafe 的全部故事,都建立在对这一步的反思上。
他们赌什么:AI 不该是对话框,该是数据库
TypeSafe 的 manifesto 叫《Composable AI: Build Prod, Not God》,核心论点三句话能说完:
第一,智能已经够用了,瓶颈不在智能本身。 他们不追 AGI 的移动靶,认为今天的模型早就跨过了「创造经济价值所需智能」的门槛。但砸了几万亿美元之后,大多数软件依然谈不上智能——说明问题不是模型不够聪明,而是智能太难被工程化地使用。
第二,RLHF 把 AI 锁死在了「助手」形态。 这是最狠的自我否定:RLHF 优化的是「人类喜欢」,训出来的模型天然需要人来确认、来点击、来兜底。而软件从来不是这么工作的:再复杂的软件也是简单逻辑分层堆出来的,每个分支可审计。
第三,智能应该像数据库一样被调用。 如果一次「聪明的判断」能像一条数据库查询一样可靠、可组合,程序员就会像堆数据库一样往上堆它:代码负责精确计算,AI 负责常识分支。
主流路线 vs TypeSafe 路线:一张表看懂
| 维度 | 主流路线(OpenAI / Claude / 国产大模型) | TypeSafe 路线 |
|---|---|---|
| AI 的角色 | 助手:陪你聊天,帮你干活 | 组件:藏在软件里自动做决策 |
| 训练目标 | RLHF:人类喜欢什么,就输出什么 | RLCD:决策校准,知道该多自信 |
| 交互形态 | 对话框,人在环上确认 | API 调用,无人值守运行 |
| 类比 | 一个聪明的实习生 | 一个可靠的函数 |
| 错误处理 | 说错了?人会看出来,重新问一次 | 必须像代码一样:极少出错、出错可查 |
| 商业模式 | 按订阅/按 token 卖智能 | 作为基础设施被分层依赖 |
再看一个具体例子。假设你在做一个电商系统,要判断一笔退款申请该不该通过:

主流玩法(助手形态):
1 | 用户申请 → 系统调用 GPT → GPT 回复"我认为这笔退款 |
AI 给的是建议,人负责决定。一天 10 万笔申请,就需要一堆审核员——AI 只是把人力从「写判断」变成了「看判断」。
TypeSafe 想要的玩法(组件形态):
1 | 用户申请 → 系统调用 Jev("这笔退款该通过吗?") |
AI 是系统里的一个分支,像 if 语句一样被调用,像数据库一样被信任。人只处理 AI 自己都不确定的边角案例。
这两个架构的区别,就是「实习生」和「函数」的区别——前者你永远要盯着他,后者你敢把它埋进系统五层依赖之下。
产品:System One Model「Jev」
首款产品是一个新模型品类,他们叫 System One Model(取心理学里「系统一」——不假思索的直觉反应,对比「系统二」的刻意思考),名字叫 Jev,目前早期访问中。
9 月中的发布演示相当行为艺术:用这个模型玩《毁灭战士》(Doom)——不是聊天,不是写代码,而是在游戏环境里实时做「前进/开枪/躲开」的决策。选 Doom 做演示的潜台词很明显:这是 1993 年的软件,没有对话框、没有人类反馈,只有纯机器决策。
他们提出的差异化训练方法是 RLCD(reinforcement learning for calibrated decisions,面向校准决策的强化学习)。跟前两代对比:
- RLHF:优化「人类喜欢」→ 学会讨好,但也学会啰嗦和自信地胡说
- RLVR:优化「可程序化验证的任务」→ 学会刷榜,但只擅长有标准答案的题
- RLCD:优化「决策校准度」→ 学会知道自己在什么场景该多确定,拿不准就明说
manifesto 里的安全观也很务实:安全是分层的前提。你只敢把可靠的组件埋进系统五层依赖之下——可检查、可测试、可逐层约束,别人才能在它上面继续盖楼。他们想要的终局是一套「智能原语生态」:像数据库和互联网协议一样,底座足够可靠,上层长出没人能自上而下设计的东西——Google 之于数据库,Stripe 之于网络协议。
「我们要造的是生产系统,不是神。」(We’re building prod, not God.)
怎么看:反主流叙事的豪赌
几个冷静的观察:
1. 方向极其非主流,但空白是真实的。 整个行业在卷 assistant 体验和 Agent 工作流时,TypeSafe 在赌「非助手型、可组合的机器决策模型」这个没人占的位置。钱都在往「更聪明的助手」里灌——Anthropic 刚签下 14.8GW 算力,OpenAI 重度用户日烧 7000 美元 token——没人给「更可靠的组件」定价。这既是机会,也可能是信号:这个位置没人占,也许只是因为需求还没被验证。
2. 「RLHF 发明人反 RLHF」有叙事张力,但要看兑现。 Jev 玩 Doom 的演示更像话题营销,真正要证明的是:这个模型在真实系统里做决策,误报率、可审计性、成本能不能打过「通用模型 + 工程封装」的笨办法。值得对照的是上周的 alibaba/open-code-review——它用「确定性工程 + Agent」的混合架构,把同样底层模型的审查质量做到了 token 消耗 1/9。这是「工程派」的答案:模型不够可靠,就用工程补。TypeSafe 是「模型派」:把可靠性直接训进模型里。两条路线谁赢,是未来两年最好看的战役之一。
3. 对开发者的现实意义。 短期内你不太会用上它的产品(waitlist 阶段、无定价、无 API 文档)。但这个方向值得放进你的技术雷达:如果「AI 作为可组合组件」成立,未来你的系统架构图里会出现一个新方块——不是「调用 GPT 的胶水代码」,而是一个跟 MySQL、Redis 并排的「判断服务」。
一句话总结:团队履历真顶级,方向真前卫,证据真少。等 Jev 的早期访问和第一笔融资消息——如果「RLHF 之父」都认为助手形态到头了,这件事本身就值得所有做 AI 产品的人想三分钟。
你觉得 AI 的终局形态是「人人对话的助手」,还是「沉入系统、无人察觉的组件」?评论区聊聊。
参考链接
- TypeSafe AI 官网
https://typesafe.ai - Manifesto: Composable AI — Build Prod, Not God
https://typesafe.ai/manifesto - 团队页
https://typesafe.ai/team - What’s Next After RLHF? — Diogo Almeida 演讲(YouTube)
https://www.youtube.com/watch?v=cJ0EOzey--o - The Register:TypeSafe AI debuts model for machines that plays Doom(2026-09-16)
https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/
本文标题:RLHF 联合发明人出走创业:他不做 ChatGPT 的接班人,要做「AI 的数据库」
文章作者:AwesomeYang
发布时间:2026-09-18
最后更新:2026-09-18
原始链接:https://awesomeyang.com/2026/09/18/2026-09-18-typesafe-ai/
版权声明:未经允许禁止转载,请关注公众号联系作者
