豆包大模型再更新,发力多模态编程,一手实测来了
国庆、中秋双节快到了,出游的地方想好了吗?
这件事,AI 已经能帮上忙。我们只给了模型一段话,它依靠出色的多模态编程能力,交出了一份可交互的 3D 山西旅行导览。
提示词:收集整理山西旅游相关知识和信息,绘制一份 3D 山西旅行景点地图/导览,可移动并可交互点击,了解各个景点在哪,主要看点是什么,有什么游玩 tips。画面清晰、好看、有趣。
结果相当惊艳!打开页面,首先是一张汇集山西代表性景点的山水风格首页。进入地图后,模型按照山西的海拔起伏搭出了 3D 地形,配色清爽耐看,整体信息也大致准确,还推荐了 4 条主题旅游路线。
这是字节前两天上线的新版豆包 2.1 Pro(版本号:0915),API 已在火山方舟全量上线,豆包工作同步接入。
官方公布的更新方向有四个:多模态 Coding、Agent 专业任务交付、面向 3D 与专业图文的多模态理解,以及 Token 效率。其中最受关注的是多模态编程,也就是让模型看着设计稿、图纸、录屏写代码,再根据运行画面继续修改。
过去几天,我们围绕该模型做了一轮集中实测。
跟着小王子 从一幅画开始
正巧,最近有位同事带了本《小王子》来编辑部,所以在这一轮实测中,我们决定跟着小王子走一趟:给他建星球、盖房子,再帮他和地球保持联系。
第一站,是小王子的 B612 星球。
这是一颗很小的星球,上面有三座火山、几棵猴面包树和一朵玫瑰。我们的需求是:在这颗星球上设计一栋房子,整体做成一个可以摆在桌上的微缩星球摆件,并且能旋转、能看到昼夜变化。输入相关提示词,结果如下:
从模型生成效果看,成品的摆件感很足,玫瑰开放、昼夜交替,光影与色彩的过渡都很柔和。小王子说自己有一天看了 44 次日落,模型把昼夜循环的最高速度也设成了一天 44 次。
搭建过程中,模型会自己截图、上手操作场景,发现问题后再回头改代码。

模型自主截图操作示意,5 倍速。
星球有了,房子也得讲究一些。
我们找来一张小王子城堡的外观五视图,让模型据此重建 3D 模型。


提示词:基于这张城堡的外观五视图,构建一个 3D 模型,要求同步生成室内布局,并且可以打开屋顶查看。
结果并非 100% 完美复刻,但整体过关,城堡各部分的空间关系还原得相当准确。提示词之外,模型还主动加上了自动旋转和墙体透视。
现在,小王子已经安好了家,我们该怎么联系他呢?
不如送他一台苹果刚发布的 iPhone Duo,当然,是数字版的。
我们让豆包 2.1 Pro 基于三张图片和两个视频生成了一个 iPhone Duo 折叠概念演示,并且其中还安装了一个可以通过折叠方式游玩的 Flappy Bird 小游戏。
这个任务的难点在于,折叠方式和游戏玩法都只存在于视频里,模型要先看懂画面中的开合动作和游戏规则,再把它们写成代码。
读取并理解文件夹中的两个折叠屏视频展示和相应图片,然后构建一个 iPhone Duo 模型程序。一开始的界面是折叠起来的,用户可以点击侧边位置打开,然后界面上有一些图标,其中有一个 Flappy Bird 图标,点击这个图标可以打开视频中演示的游戏。用户可以点击空白处实现虚拟 iPhone Duo 的折叠,并玩这个游戏。
交互的完成度不错:数字版 iPhone Duo 的两块屏幕做到了与 Flappy Bird 的翅膀同频,扇动起来穿过一个又一个的关口。有趣的是,豆包 2.1 Pro 还给这个小游戏起了一个恰到好处的名字:Foldy Bird。美中不足的是,最终样式与真实 iPhone Duo 略有差异,倒是更像 Surface Duo。
从一颗星球到一座城堡,再到一台能折叠的手机,小王子的家算是安顿好了。这一路上,豆包 2.1 Pro 接收的信息不只有文字,还有设计图和视频。它必须去看,并且看懂,才能真正开始动手去创作。
小王子的故事先讲到这里,现在回到我们的日常生活。
从星球回到地面 只需一张图,豆包能盖房
现实中需求,往往就是一张图:一张建筑平面设计图、一张庭院设计图或一张随手画的草稿。
先从一张建筑平面设计图开始,我们让豆包 2.1 Pro 将其转化为了可交互的三维模型。这里,模型能获得的信息几乎全部来自平面图本身。对缺乏多模态理解能力的模型来说,这类任务很难仅靠文字推理完成。


新版豆包 2.1 Pro 读懂了平面图中各类图例的含义,并据此还原出空间布局。更有意思的是,它还考虑到了用户会怎样查看这个模型,主动加入了隐藏屋顶、自动旋转和视角切换。它理解的不只是图,还有人会怎么使用这个结果。
这与官方披露的方向一致:据字节介绍,新版模型对工程图纸中尺寸标注、公差符号的识别精度有所提升,也能更准确地识别 CAD 工件等 3D 物体。
更进一步,你甚至可以把自家庭院「搬」进数字世界,再让它快速经历四季。
提示词:参考设计图,做一个 web3D 的庭院,然后模拟春夏秋冬四季,生成不同季节的庭院风貌。
最后,是一张我们自己手绘的潦草草图。我们让豆包 2.1 Pro 据此构建一个支持多主题切换的个人工作台:


提示词:基于这张手绘图,构建我的个人工作台主页。设置中支持多主题切换,包括极简风格、像素画风格、水墨画风格、莫兰迪色风格、Atom 编辑器经典风格、Aurora Gradient、赛博朋克等。不懂的先问我,清楚后再构建。
结果相当好,我个人尤其偏好其中的赛博朋克风格。而且它还提供了非常丰富的个性化设置能力,让我们可以将其配置成真正实用的个人工作台。
测试最后,我们再看看「鹈鹕骑自行车」的任务表现。
这是 AI 圈流传很广的民间测试,源自开发者 Simon Willison 常用的一句提示词:Generate an SVG of a pelican riding a bicycle。本次测试,我们加点力度,在2D基础上,要求生成3D像素风的。
Seed2.1 Pro 升级版先交出一版 2D 动画,接着按要求给出了 3D 结果。

可以看到,鹈鹕的外形特征、双腿骑车时的运动姿态都被表现出来,主体与背景树木之间也呈现出了合理透视关系,随着镜头变化,身体与车身的空间关系依然保持稳定。
看图写代码的背后 新版豆包 2.1 Pro 更新了什么?
测完回过头,再来看看这次更新本身。
本次更新的豆包 2.1 Pro 0915 基于 Seed-Evolving 最新版固定而来。后者于今年 6 月对外公开,在短短 3 个月内保持高频自进化迭代,多模态编程能力已达到国内领先水平。
其核心亮点主要体现在两个方面。
一是更懂复杂代码仓库。官方披露,在开源游戏 Luanti(约 38.7 万行代码、1000 个真实历史 Issue)的自主修复中,模型调度多个子 Agent 连续运行近 36 小时,完成根因定位与跨文件修复,83% 的任务达到可合并标准。

二是「看图写代码」。借助视觉理解能力,模型可以直接读懂设计稿、图纸和操作录屏,再转成前端代码和游戏逻辑。
官方展示的一个案例中,一套没有文档的老 ERP 系统,只提供一段操作录屏和几张草图,模型读懂了约 28 万行 Java 代码,依据录屏与草图开发出移动端页面,并跑通了完整业务链路。
支撑这些的,是多模态理解能力的提升。前面城堡五视图、平面图、iPhone Duo 视频这几个测试,考的正是这些能力。
Agent 方面,模型强化了证据溯源、权威信源检索和数据核验,幻觉明显减少,在金融投研这类需要多轮调研、产出长报告的专业任务中,交付更加可靠。
iPhone Duo 首年出货量预测分析,豆包 2.1 Pro 派出了 4 个子智能体进行预测核实,得到了非常详实的结果,同时也列出了无法核实的信息这些能力的背后是字节在多模态上的长期积累。
目前,豆包 2.1 系列模型在视觉理解、Computer Use、Mobile Use 等任务上都处于相当领先的水平;在创作侧,Seedance、Seedream、Seed Audio 分别覆盖视频、图像和音频生成。
成本上,新版图像推理和视频推理的 Token 消耗比上一代减少 30% 以上,对看图写代码这类需要反复截图、对照画面的任务来说,这一点很具备吸引力。
目前,开发者可直接在火山方舟调用 Doubao-Seed-2.1-pro-0915 模型,普通用户下载升级豆包工作最新版,选择「豆包 2.1 Pro(0915 新版)」即可体验。

让机器看懂人
编程,从来就不仅仅围绕文本一种模态。
真实工程里的大量知识,藏在设计图、软件界面、操作录屏,甚至老员工的操作习惯里。前端工程师的日常,也有很大一部分是把别人的设计一点点变成代码。只会读文字的编程模型,天然缺了一条腿。多模态补上的正是这一条。
从技术发展路线看,编程正在越来越多地和多模态能力结合,这也是 AI 编程走向生产级落地的必修课。
越来越多地,编程智能体开始带着一双「眼睛」去工作:可以看界面、看图片、理解空间和视觉反馈,再决定代码应该怎么写。与此同时,编程能力本身也不再只是服务于「做软件」,它正在变成 AI 解决通用任务的一种工具。
再从字节视角看,豆包 2.1 Pro 的更新,正凸显其在多模态领域的优势:将以 Seed Audio、Seedance、Seedream 为代表的领先技术积累,进一步整合并转化为面向真实工作场景的生产力。豆包大模型正在将「编程模型」和「通用 Agent」能力不断融合,服务越来越多的生产力场景。
而更深的变化,发生在人与机器之间。过去几十年,是人在学习机器的语言:写代码,写 PRD,写接口文档,把想法一层层翻译成机器能执行的格式。
现在,机器开始学着看懂人的表达:一张随手画的草图,一段录下来的操作,一次屏幕上的演示,都可以直接成为开发的起点。
从人读懂机器,到机器读懂人。当模型有了「眼睛」,代码就成了它的「手」。