a16z 投资合伙人观察:AI 代理会操作电脑了,但企业真正在乎的不是模型
BiRun 消息,作者:a16z 编译:深潮 TechFlow 深潮导读: 当计算机使用 AI 从演示走向规模化生产,投资者需要关注的不再是哪个模型跑分最高,而是哪些公司能把验证、容错、流程知识等软性能力变成可复用的产品。这篇文章拆解了一线团队的真实部署数据,揭示了 AI 代理落地企业后台的真正瓶颈和护城河所在。 代理能用电脑了吗?我们用数据回答当你最重的用户不再查看排行榜,排行榜就不再是故事这道理似乎很简单,但如果你离开硅谷,去世界其他地方告诉人们:「有一种叫代理的东西,相当聪明,能和你一起完成工作,还能自动化你工作中那些重复的部分」,对方很有可能会问:「它们能用电脑吗?」 这是个好问题!它们到底能不能?在未来几十年里,我们要去释放的生产力潜力,贯穿在极其日常的工作中:一个代理能不能(比喻意义上的)24 小时坐在办公桌前,被信任地用浏览器、填表格、点对按钮、不出错?这就是业务流程外包的领域,过去这意味着「这个工作能不能外包出去?」,但现在有了全新代理驱动的新前沿。我们去年写过这个话题,当时计算机使用的前景还基本只是一堆演示。从那时起,变化很大。 模型进步的速度几乎超出所有人的预期。能够使用电脑的代理开始在规模化生产中站稳脚跟,面向那些狭窄、可重复的工作流:更新记录系统、在门户间搬运数据、处理工单、核对记录、搞定那些没有清晰 API 的长尾软件。有了合适的基础设施,计算机使用能力现在可以部署来处理端到端的任务,而此前这些工作需要人工监督或直接由人完成。 如今,利用计算机使用能力的工作流远非完美:当工作偏离标准操作手册时,代理会很脆弱;在某些无法缓存的用例中(详见下文),成本高到让这笔账算不过来。但我们已看到标准化后台工作的生产部署,特别是那些否则就得人工点击遗留系统的工作;成本曲线开始变得有吸引力,考虑到利用计算机使用的工作流提供结构性优势,比如全天候可用,以及最重要的——可扩展以应对需求。 第一波计算机使用基础设施的目的是让代理具备能力:看、点击、打字、从错误中恢复。下一波则是让它们在真实的公司里变得有用。当原始页面导航成为模型层的大宗商品,模型就不再是主要瓶颈,持久的优势会向上转移:上下文、权限、流程知识、验证、升级、错误处理、缓存,以及在某个具体客户组织内工作到底如何完成的、来之不易的理解,从而端到端地映射一个工作流。换句话说,前沿正从「代理能用电脑吗?」转向「它能靠谱地干这份工作吗?」 从人类盯着每一步到真正自主的工作流一年前,最好的计算机使用模型在 OSWorld-Verified 上得分 42% ;今天最好的模型得分 85% ,超过了人类在同一任务上约 72% 的成绩(这意味着它们成功完成了 100 个任务中的 85 个)。在生产中,这些通用前沿模型的表现很像基准测试中的样子:各大实验室把计算机使用作为 API 暴露——模型获得一张截图,返回点击和按键, OpenAI 的 CUA 在可用时还会叠加无障碍树或 DOM 数据——构建者则把这一循环包裹在自己的控制体系里:一个沙盒虚拟机或浏览器,外加编排、验证和重试逻辑。值得注意的是,几乎没人为此部署消费级产品(比如 Claude 、 ChatGPT 的代理模式)——创始人和企业直接构建在原始 API 上,或者向打包这些 API 的供应商购买。能力的飞跃正是让这些设置变得可行的原因,「直到 2026 年 2 月Opus 4.6 出来,模型才真正靠自己在生产环境中够用了,」一位正在此领域创业的创始人如此说道。在过去十八个月里的某个时间点,计算机使用能力跨过了从演示到可以实地部署的门槛。 图: OSWorl
评论
0/500
登录 后参与讨论
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯