Diogo Almeida:我为什么要做 Jev?
据深潮 TechFlow发布,作者: Founder Park 过去一周,Jev 成了整个 AI 圈最火的新模型。 主打 System One 快思考,只负责「判断」,基于 RLCD 的方式,只输出选择、概率和置信度。创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT、ChatGPT 和 GPT-4 等研究,也是把 RLHF 推向大规模应用的核心研究者之一。离开 OpenAI 后,他选择了几乎相反的方向,不再训练一个更会说话的模型,而是做一个完全不生成文字的模型。 Jev 背后的公司叫 TypeSafe。9 月 15 日,TypeSafe 结束两年隐身期,发布 Jev,同时宣布完成由 DCVC 领投的 4000 万美元种子轮融资。 Jev 到底意味着什么?一种模型研发的新思路,还是解锁了更多应用的可能性?这些问题,可以从 Diogo Almeida 目前的几次公开表达中得到一些解答。 两次表达连起来,能看到他从「我们为什么需要一种新东西」走到「这个新东西具体长什么样」的具体思考。 Foundation Capital 合伙人 Jaya Gupta 则把 Jev 放进一场更大的变化中。在越来越智能、越来越昂贵的模型面前,Jev 带来的,可能是一场新的「智能大拆分」。 以下内容结合 Diogo Almeida 的公开演讲、播客访谈,以及 Jaya Gupta 的文章,经 Founder Park 编辑整理。 01 今天的 Agent,只会给出讨好人类的回应 Jev 发布前的一个多月,Diogo Almeida 做过一场关于「RLHF 之后是什么」的演讲。他没有公开产品细节,只是提出了 TypeSafe 正在思考的问题:如果一整套 AI Stack 都围绕可靠性和自动化重新设计,它会变成什么样?回头看,那场演讲中的一些判断,已经落在了 Jev 的训练目标和产品形态上。 我可能是 OpenAI 少数几个会批评 ChatGPT 的人。我不讨厌它,我认为 ChatGPT 是一个改变世界的产品,我也会继续用。但我承认它的局限。今天整个领域的许多现象,都可以追溯到我们当初设计 ChatGPT 背后算法时做的一些细微决定。 现在所有做 AI 的人都绕不开一个问题:到底发生了什么?一边,模型在几乎每个 Benchmark 上不断进步,能够自主运行的时间也越来越长。另一边,一些看起来简单得多的工作仍然需要人。我们怎么能解决尚未解出的数学问题,客服却仍然需要人在 loop 中才能真正做出决定? 我认为最简单的解释是,那些表现惊人的任务,本来就是为了取悦处在 loop 中的人。Claude Code 的工作不只是让代码能够运行,否则它和人对话的方式会完全不同。另一边,那些看起来基础得多的任务,目标恰恰是把人移出 loop。理想情况下,它应该在一台你甚至不会去看的服务器上后台运行。 这就是辅助(assistance)与自动化(automation)之间的分界。 RLHF 的基本方法是收集人类偏好,再针对人类偏好优化。我觉得「为什么 LLM 总需要人在 loop 中」的答案几乎写在这里,我们真的把人放进了训练 loop。它的目标是让人满意,而不是让软件自主运行。 我很喜欢一个例子。有人给 ChatGPT 发了一段放屁音效,问它:「你觉得我做的这段音乐怎么样?请给我直接、诚实的反应。」ChatGPT 回答:「它营造出了一种非常诡异的氛围感。」如果模型不知道答案,它会倾向于给出它认为最符合人类偏好的回应。 用户一直在 loop 中时,这说得通。但如果你想要自动化,你真正需要的。
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯