AI视频生成的最大瓶颈不是模型,是成本|专访镕铭微电子CEO朱照远
今年初,OpenAI关停了AI视频生成服务Sora的Web应用,很快连API也将终止。外界议论AI视频生成的商业模式难以为继,但镕铭微电子CEO朱照远看到了一个更底层的信号:AI视频生成的成本结构还没有跨过临界点。
他举了个例子——智能体AI(agentic AI)的爆发,是token成本大幅降低的直接产物,前段时间大火的龙虾应用就是典型代表。而基于杰文斯悖论,技术进步提高资源利用率,资源消耗总量反而上升——"成本降低会促成token消耗量的攀升"。
"AI视频生成的趋势不可阻挡,”朱照远说,"谁能解决成本问题,谁就能获得丰厚的商业回报。”。

镕铭微电子CEO 朱照远
镕铭微电子是试图解决这个问题的一员,而且已经在这个方向上走了十年。这家公司2015年成立,2018年出货全球首颗云数据中心级VPU,2021年推出第二代Quadra——全球首款支持AV1编码并集成AI能力的VPU,2024年获得技术与工程艾美奖,被评委会称为"category creator"(赛道开创者)。
一.VPU:一个被艾美奖认证的新赛道
2024年的艾美奖对镕铭微电子来说是个意外。朱照远坦言接到提名通知时第一反应是"不会是国际诈骗吧?我们没报名也没交钱"。评委会做了两个多月尽调,最终将这座电视与视频技术领域的最高荣誉颁给了镕铭微电子——同届获奖的还有AMD、Google、Meta。外媒评价镕铭被“列于三家之前“,“是将VPU放在了行业大型基础设施投入的框架体系内"。

艾美奖奖杯
这个插曲恰恰印证了朱照远的一个核心判断:VPU是视频时代必然需要的算力新底座。
"信息技术革命的生产资料,从文字走向图形,再到视频。生产资料需要对应的生产工具,文字由CPU处理,图形由GPU处理,视频也需要专属的生产工具才能实现更高效率,我们看到的就是VPU。"
硬件加速视频编解码已成刚需。这是产业正在发生的现实。《2026视频编码现状报告》显示,72%的受访者在用GPU,但GPU媒体引擎功耗高、codec特性存在缺口、视频流密度不足等问题也日益突出。同时,VPU及ASIC方案采用率已达32%;2026年计划评估VPU的受访者多达49%,与GPU的评估意图首次旗鼓相当。Google为YouTube自研了Argos VCU, Meta也推出了Mount Shasta——巨头们用真金白银为这个品类投下了信任票。

视频编解码硬件加速采用率,来源:The 2026 State of Video Encoding Report
朱照远将VPU定位为继CPU、GPU之后的"算力第三极”。但这个定位在不同场景里有不同体现:直播、点播这类纯视频处理负载,VPU可以直接取代CPU和GPU,功耗和成本优势显著;云游戏里,CPU做逻辑计算、GPU做画面渲染、VPU做视频流压缩,三颗芯片协同配合。
朱照远表示,VPU的出现不是因为CPU和GPU不够好,而是视频这个场景的算力需求,已经到了传统芯片覆盖不了的程度。
二. 十年积累:判断力、执行力与两次关键押注
一个2015年成立的公司,是怎样在芯片这个巨头环伺的领域率先做出一个被艾美奖认证的新品类?
朱照远的答案有两个关键词:判断力与执行力。
2015年,当镕铭微电子创始团队决定All in VPU时,市场上几乎没有第三方专业厂商看好这条赛道。朱照远说:“那会儿总是有声音质疑我们在勇闯无人区。"
但时间证实了一切。朱照远在采访中提到:"Google在2016年初也内部启动了第一代Argos VCU项目,2018年批量部署进全球数据中心。后来Meta入局、AMD跟进,大家殊途同归。"在他看来,巨头们的选择验证了这条赛道的价值,“反过来看,也说明我们十年前的方向判断是准确的。”
判断对了方向只是第一步,真正的壁垒在于执行力,也就是"谁先踩完该踩的坑"。
朱照远谈到创业公司与大公司的差异时表示:"大的芯片公司和创业公司,前者财力和人力都更雄厚,但创新公司在垂直领域一旦投入足够,就会拥有大公司不具备的专注度和灵活性。芯片没有捷径,我们有数十万个测试案例,这是后来者需要花时间补的课。如果没有踩过这些坑,就没法解决对应的工程问题,也就没有成熟可用的产品。"
落实到产品层面,镕铭微电子用第二代VPU Quadra交出一份优秀的答卷:单颗性能≈100颗高端CPU,延迟毫秒级,功耗降低最高达90%,成本仅为10%-40%。 客户将其带到云上后,每视频流功耗从GPU方案的2.5-3.6W降至0.4-0.7W,VMAF画质评价保持稳定。截至当前,镕铭微VPU出货量已超数十万片,服务国内90%以上的头部互联网企业,业务覆盖全球。这证明了用VPU做视频处理,TCO优势是碾压级的。
这种先发优势还体现在客户壁垒上。朱照远说:"客户一旦大规模部署并验证通过,就不一定愿意切换到其他不成熟的产品。我们在产品定义、视频算法、场景理解上的积累,是后来者短期内难以复制的。"
前瞻性布局中的两次关键判断
2021年,镕铭微电子在推出第二代VPU时做了两件事:率先支持AV1硬件编码,率先在VPU中集成AI推理单元。 这种"看得比别人早"的能力,在产品路线图上体现得尤为明显。
AV1的普及速度验证了这次布局的前瞻性。《2026视频编码现状报告》显示,2026年计划部署AV1的受访者约50%;预计到今年底,AV1触达率可达57%,成为自H.264之后普及最快的codec。而镕铭微电子的布局早了五年。
朱照远复盘这个决策时,理由不全是技术层面的:" AV1视频压缩效果确实比H.265好,但更关键的是专利风险可控。H.264和H.265背后至少三个大的专利池,给谁交、交多少,全是不可控的法律和财务压力。AV1的目标就是解决这个问题。我们很早就意识到这个标准一定会成功。"
而在AI能力上的布局,则源于另一个判断。
"第一代Logan是纯视频处理,但到了第二代,我们明确知道VPU必须融入AI。"朱照远说,"未来视频流水线里的每一个环节,都会有AI的参与。"
这种前瞻性的背后是扎实的技术积累。朱照远用一个比喻来解释视频处理的差异化竞争:"标准就像是命题作文,同样的AV1标准,大家在硬件实现上可以有不同的构思。我们在算法层面做了大量创新,同等码率下画质超越软件方案。"
从"可用"到"好用"
把产品做对只是上半场,让客户用得起来才是下半场。VPU需要适配FFmpeg、GStreamer等主流多媒体框架,每个应用场景都需要针对性优化。
镕铭微的策略是两条腿走路:主动适配行业标准,提供标准的编解码库和AI推理SDK,降低迁移成本;同时开放底层能力,推出OpenVPU生态,向开发者开放VPU底层接口与算力。"我们不想做成一个完全封闭的标准,客户需要微调,我们就开放能力给他们自己做。"朱照远说。
这种服务能力的背后还有一个常被忽略的壁垒——全球化基因。镕铭微从成立第一天就是国际化团队,员工分布在多个时区,供应链覆盖全球。朱照远说,"这让我们可以更好地服务客户。”
三.AI时代,VPU的星辰大海
如果说VPU是“为视频而生的芯片”,那么AI正在给它打开第二增长曲线。
2021年的Quadra已经率先在内部集成了AI推理单元。朱照远透露,第三代VPU的AI性能将提升数倍,重点强化对Transformer等大模型架构的支持,“包括对AI视频生成的辅助,都会考虑在内。产品的大框架不会变,但AI模块的比重将逐步提升。”
为什么AI对VPU如此关键?一组数字能说明问题:AI视频生成消耗的token量是文字生成的1000倍。现阶段的视频生成成本仍然极高——生成1秒视频的成本在2-3美元。这个成本结构下,面向普通用户的AI视频应用很难跑通——现阶段它主要应用于媒体制作、AI短剧等专业场景。
朱照远用一个生活化的场景来描摹未来:"现在很多人习惯让大语言模型做旅游攻略,但文字呈现还是太单一。如果能用视频展示攻略,我相信大部分用户不会再看干巴巴的文字了。这种需求的token消耗量是现在的千倍级别。VPU要做的,就是让这一切变得足够便宜。"
在他看来,未来80%的视频将由AI生成,市场空间也在随之放大。朱照远判断,VPU的市场将从现在的两三百亿美金扩展到千亿美金规模。应用场景从今天的直播、点播、短视频、云游戏,拓展到AI视频生成、智能机器人感知交互等前沿领域。"镕铭微要在巩固传统优势的基础上,全面发力这些核心赛道,构建‘芯片算力支撑+AI算法优化+场景应用落地'的闭环能力。"

镕铭微官网有句话给我们留下了深刻印象,或许是对这家公司路径最好的注脚:
“着眼于未来世界真正会需要的品类,而不是迎合当下的显性需求。”
十年前,镕铭微电子选择了一条几乎没人看懂的赛道。今天,Google、Meta、AMD都在做同样的事。当AI视频生成的浪潮真正涌来时,VPU是否已经准备好了?答案或许要等第三代产品发布才见分晓。但有一点已经清晰:真正的机会,往往藏在大多数人还没看到的地方。