当AI遇上电路板:一场迟到的能力评估
OpenAI在GPT-6 Astra模型的发布页面上展示了一段AI在KiCad电路板设计软件中操作的演示视频,将人工智能与硬件设计的结合推向公众视野。然而,一个更根本的问题随之而来:AI设计出的电路板质量到底如何?刚刚发布的EEBench V1基准测试正是为回答这一问题而构建。EEBench团队指出,当前大语言模型掌握的电子学知识远比其在传统设计工具中输出的结果所显示的丰富——它们读过教科书、数据手册、应用笔记和大量代码,但当被要求操作图形化CAD工具时,却在菜单点击、坐标追踪和界面状态管理上消耗大量上下文资源,导致最终产出与其知识储备极不匹配。
atopile声明式编程:绕开GUI的全新路径
EEBench采用了不同于传统GUI操作的评估方式,要求AI模型使用atopile这一声明式硬件描述语言来编写电路。在atopile中,电路以代码形式存在——元器件、连接和电气约束都在声明式语法中直接表达。模型可以直接修改设计、执行构建、运行仿真并检查失败原因,完全无需离开项目目录。这种设计大幅压缩了评估中用于测试「计算机使用能力」的部分,将更多精力集中于测试「电子学知识」本身。EEBench团队的实践经验表明,使用atopile作为中间层的效果远优于让模型在GUI中画线。
住宅电能表任务:一个看似简单却暴露AI短板的真实案例
EEBench V1中一个公开测试任务基于真实的住宅电能表设计场景:当电能表的五伏供电消失后,电路必须将处理器的供电再维持二十毫秒,使处理器有足够时间将累积读数保存到非易失存储器中,而被保护的电源轨在整个断电窗口期间都不得低于处理器的三伏欠压阈值。大多数AI模型能直觉地想到正确的基础方案——在电源轨上并联一个电容。但真实的电容器让这个问题变得复杂得多。以陶瓷电容为例,当其两端施加工作电压后,实际有效电容量可能远低于标称值;同时所有元器件都存在公差,更大的电容量意味着更高的成本和更大的占位面积,同时也会延长供电恢复后的充电时间。
一次真实失败的深层原因
在EEBench的仿真评估中,一份提交的设计方案使用了标称容量为二十二微法的电容。然而在四点七伏偏置电压下,仿真器测量到的有效电容量仅为十一点四微法,远低于任务所需的五百四十五微法最低要求。电源轨在断电后仅零点八五毫秒就跌破了三伏的阈值,远远未达到二十毫秒的维持时间要求。这一案例精确地揭示了当前AI模型在硬件设计中的核心弱点:它们能够「理解」正确的设计原理(并联电容储能),但在将原理落地为满足真实物理约束(电压-电容特性曲线、公差、成本限制、占位面积)的具体方案时,出现了根本性的偏差。电路「能成功编译」并不意味着「能正常工作」。
从能源表到滤波器:AI硬件设计能力的梯度测试
除了相对基础的储能任务外,EEBench还包含更复杂的模拟电路任务。在较高难度的测试中,AI模型需要围绕运算放大器综合一个多反馈低通滤波器——这意味着要根据目标截止频率和增益要求,联立方程求解电阻和电容的比例关系,同时在整个工作频段内保持滤波器的稳定性。这类任务不仅考验模型对模拟电路理论的掌握程度,更考验其在多约束条件下进行数值优化的能力。EEBench将这类任务定义为评估AI从「会用工具」到「理解工程」这一跃迁的关键标尺。
EEBench生态与评估体系展望
EEBench V1已正式上线排行榜和方法论文档,允许开发者提交模型评估结果。该基准使用ngspice作为底层电路仿真引擎,可以精确模拟从开关瞬态响应到频率特性曲线的各种电路行为。atopile的ato v2语法则为电路描述提供了足够丰富的表达能力,能够覆盖从简单储能电路到复杂模拟信号链的广泛场景。团队表示正在不断扩充测试任务库,以覆盖更广泛的工程实践领域,包括高频数字信号完整性、电源管理集成以及混合信号设计等更高层次的挑战。
从行业发展的角度来看,EEBench填补了AI能力评估在硬件工程领域的重要空白。主流AI基准测试大多聚焦代码生成、数学推理和自然语言理解,而电路板设计涉及物理约束、多目标优化和工程直觉,一直是AI评估的盲区。GPT-6 Astra在KiCad中的演示固然亮眼,但EEBench的数据表明,把演示级操作转化为可量产的工程产出还有很长的路要走。AI在电子设计领域的真正价值,很可能首先体现在辅助而非替代——帮助工程师快速生成候选方案、自动运行参数扫描与可靠性仿真,最终的设计决策仍需人类专家把控。