Reka发19B Rho-1:一个模型同时处理图文、视频和机器人动作

BiRun 讯,由前 DeepMind、Google Brain 和 Meta FAIR 研究人员创办的美国 AI 公司 Reka 发布 190 亿参数模型 Rho-1。它可以在一次对话里处理文字、图片和视频,还能输出机器人动作。比如先生成一张灯塔图片,再让灯塔动起来、修改视频里的天气,最后继续追问两段视频有什么区别。前面生成的内容会一直留在上下文里,不需要重新交给另一个模型处理。

它还支持在视频生成过程中继续接收指令。视频正在往前生成时,用户可以临时要求改变天气、运动方向或其他内容,后面的画面会接着调整。基础版生成速度约为实时的 0.79 倍。蒸馏版把生成步骤从 99 步压到 8 步,Reka 测得约 1 秒可以生成 5.3 秒视频。

机器人也接在同一个模型里。Rho-1 一边预测摄像头接下来会看到什么,一边输出机器人的动作信号,不需要再让一个单独的规划模型决定怎么动。目前官方展示的还是 LIBERO 仿真任务,没有公布实体机器人的测试结果。

类似的统一模型今年已经出现过。英伟达 Cosmos 3 也能统一处理文字、图片、视频、声音和动作。Rho-1 更偏向连续交互,重点展示同一个上下文里反复生成、修改和继续推理。

Rho-1 从零训练,使用 320 张 H100,训练约 3 个月。当前视频分辨率为 672×384,长视频仍可能出现画面结构漂移,视频定位和局部编辑也不够稳定。模型目前只是研究预览,权重和 API 都还没有开放。

信源

动察 Beating 频道 · 动察 Beating 交流群。
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯