The Decoder 1小时前 · 2026-10-06 09:31:54 · 3 阅读
Reka AI 发布全模态模型 Rho-1,统一处理文本、图像、视频及机器人控制
Reka AI 发布了 Rho-1 的研究预览版。这款 190 亿参数的全模态模型在单个神经网络中就能处理和生成文本、图像、视频以及机器人控制指令。与大多数把任务分派给专用模型的 AI 系统不同,Rho-1 将所有模态作为 token 放在同一个共享上下文窗口中运行,无需工具调用或外部模型。它能实时生成连续视频,并且可以随新指令即时调整,无需重启。
预测摄像头图像的同一组权重,也能驱动机器人的运动。为了解决机器人训练数据稀缺的问题,Reka AI 构建了一个逆动力学模型,可以从普通互联网视频中提取控制信号。Rho-1 在 320 块 H100 GPU 上训练了约三个月。
Reka AI 在多模态 AI 领域并非新手。2024 年 4 月,该公司就发布了Reka Core,一个在基准测试上可与 GPT-4、Claude 3 和 Gemini Ultra 较量的多模态语言模型。此次发布也契合了 AI 研究界对所谓世界模型的广泛探索。
原始来源: The Decoder