AI 能设计电路板了吗?
昨天 OpenAI 在首页发布了 GPT-6 Astra 使用 KiCad 设计电路板的演示 Demo,让我们颇为兴奋。很高兴看到电子产品出现在这样的大型模型版本更新中。
显然,我们离只需一条提示词就能让 AI 从零到一造出一整部手机还有很远的距离。但这个演示确实引出了一个我们一直思考的问题:如何衡量 AI 产出的电子产品质量到底如何?
这些模型对电子学的了解出乎意料地多
我们的经验是,当前模型在电子学方面的知识储备,其实远超它们在传统设计工具中输出的表现。它们学习过教科书、数据手册、应用笔记以及大量代码。
你或许可以让智能体去操控图形化的 CAD 工具,但这样做会花大量时间去点击界面和处理屏幕上的各种状态。其中大量的上下文信息都由坐标、菜单项和应用状态组成。
EEBench 改用 atopile。电路由声明式代码描述,因此智能体可以直接操作元件、连接关系和电气约束,在设计修改、编译、仿真以及检查失败原因的过程中无需跳出项目。
这比让模型在 GUI 里画线要高效得多。同时,这也让基准测试可以把更少时间花在测试计算机操作上,从而更多时间用于测试电子设计能力。
.ELEC: @STD::Import {
.project &= "electronics"
.org &= "atopile"
}
.Submission: @type {
.vin: ELEC::ElectricPower
.vhold: ELEC::ElectricPower
.vhold.lv ~ .vin.lv
.c_bank: ELEC::Capacitor {
.capacitance &= 22uF +/- 20%
.max_voltage &= 10V..25V
.temperature_coefficient &= "X5R"
.package &= "0805"
}
.vhold.hv ~> .c_bank ~> .vhold.lv
}
现实世界是复杂的
公开任务中有一道基于家用电能表:当 5 V 供电消失时,电路必须让处理器再撑 20 ms,以便保存累计读数,且在此期间被保护的电源轨电压不能跌破处理器 3.0 V 的欠压阈值。
大多数模型都能凭直觉得出正确的基础结论:加个电容。
但真实电容会让任务变得更有意思。陶瓷电容在有电压施加时,实际容量可能远低于标称值;元件本身还有容差。加大容量意味着更高的成本、更大的空间,还会让电源轨在来电后恢复得更慢。按标称值算出来的设计,换上实际到货的元件可能就失效了。
EEBench 在仿真中切断输入电源并测量结果:检查整个断电期间的电压、工作点下的有效电容、来电后的恢复情况,以及封装、介质、耐压和成本等方面的限制。
电能表还算比较简单的任务。在更难的模拟任务中,agent 可能要围绕运放综合出一个多路反馈低通滤波器,解出满足极点要求的电阻电容比值,并在每个元件都被推到最坏容差角点后,仍把增益、截止频率和 Q 值控制在限值之内。测试框架会针对这些角点重建 SPICE 仿真文件,运行 AC 和瞬态仿真,把测量值绑定到命名探针上,并对照各自上下限规格记录每项结果。
不过,把公式算对只是电子工程的一部分。EEBench 使用真实的厂商元件,从数据手册中提取规格并带入 SPICE 模型。agent 不仅要在各容差角点下找到可行的组合,还要选出确实存在、可以下单、价格对产品来说合理元件。这种在电气性能、成本和供货之间做权衡的过程,比从教科书里挑选理想值要接近真实的硬件设计得多。
这是文章中最有趣的部分,因为正如其他工程学科一样,电气工程最终归结为权衡取舍。
评分方式
EEBench 的检查完全确定性执行。它会构建提交的设计,生成电路图和物料清单(BOM),并运行一组 SPICE 仿真和设计检查。每项要求对应一个带阈值的测量项。
在电表任务中,测试工具会在输入掉电又恢复期间测量受保护电源轨的行为。其他任务则测量增益、阈值、纹波、瞬态响应以及元件容差极限下的性能。技术得分会与参考 BOM 结合成本效率综合计算,而成本仅在电路正常工作的前提下计入加分。
这类似于给编码智能体提供编译器和测试用例,只不过这里的测试是在测量电压和元件行为。
EEBench V1 覆盖基于仿真的模拟与数字设计。它目前还不能判断一个模型是否能完成布局、制造并调试出完整产品,我们计划后续补充这些环节。当前版本聚焦于需求、设计和验证闭环,因为这是目前我们能客观评估有效工程工作的地方。完整 方法论与示例结果浏览器 已公开。
排行榜动态
9 月 1 日的结果令人鼓舞。Claude Opus 5 在 EEBench V1 的 13 个任务中取得 61.6% 的得分。Grok 4.6 以 57.1% 位列第二,略高于 Claude Fable 5.1 的 56.4%。几个月前,我们并不指望模型能做出这样出色的表现。
1Claude Opus 561.6% 2Grok 4.657.1% 3Claude Fable 5.156.4% 4Claude Fable 554.3% 5Claude Opus 4.8 Max51.4% 查看完整排行榜及运行细节另一个让我们倍感欣慰的结果是:xAI 将 EEBench 收录进了 Grok 4.6 模型卡,置于“工程加速”栏目下,与 3D 建模和参数化 CAD 评估并列。根据他们公开发布的运行数据,Grok 4.6 在 xhigh 推理强度下达到了 60.0% 的得分。看到前沿实验室使用 EEBench 来描述新模型的工程能力,让我们认为这正在成为人们关注的一个重要类别。
Anthropic 的模型在此类环境中一直表现稳定。Grok 的崛起同样引人注目。在其 Grok 4.6 发布博文中,xAI 表示该模型接受了高质量的工程数据和强化学习训练,训练环境涵盖包括计算机辅助设计在内的特定领域。其 EEBench 成绩恰好印证了这一说法。
目前我们测试过的 OpenAI 模型排名相对靠后:GPT-5.5 得分为 42.3%,GPT-5.6 Sol 为 39.4%。我们尚未获得 GPT-6 Astra 的成绩。鉴于它在 KiCad 电路板上的表现,我们非常期待了解它如何处理这些电路设计任务。
训练环境
一旦我们拥有能够评估电路的仿真框架,也就奠定了电子领域强化学习环境的基础。相同的检查机制可作为训练后阶段的奖励信号。
失败的运行结果同样蕴含价值:我们能看出哪个电压超出了限制、哪个工作角点失效,或者模型是否用了一种代价不必要的昂贵方案解决问题。这些信息为训练循环提供了比单纯依靠“原理图看起来合理”更强的信号。
EEBench 只是这项工作面向公众的一小部分展示。我们也在与一些想让自家模型更擅长电子设计的前沿实验室直接合作。如果你从事评测或后训练相关工作,欢迎联系我们,了解我们提供的更完整的评测套件和基于仿真的训练环境。
那么,AI 到底能不能设计电路板?
对于一批实用且不断增长的电路问题,我们认为答案已经是肯定的。但分数也清楚地表明,还有很长的路要走。OpenAI 在 Astra 的首批演示中选择了一块 PCB,xAI 在模型卡里发布了 EEBench——这些都像是同一个趋势的早期信号:AI 实验室开始认真对待电子设计了。
很快可能还会有新的数据点。Elon Musk 表示,Grok 4.7 将在几周内发布,它在大量 SpaceX 数据上做了额外训练,目标是在工程方面表现尤其出色。模型还没发布,时间表也可能变动,但如果它如描述那样到来,我们会很乐意把它放上 EEBench 跑一跑。
接下来的几周应该会很有意思。随着模型不断进步,我们会持续加入更难的任务,也期待看到 Astra 和下一代模型的表现。
你现在就可以在 atopile 里试试同样的方法。把一块你一直想做的板子交给 agent,看看它能走多远。
所以,AI 能设计电路板了吗?一部分能。我们还不至于让它设计心脏起搏器然后直接装进人体,但这一天正在到来。
EEBench 由 atopile 团队构建并出资维护。公开评测的运行费用由我们承担,我们不出售评测成绩。