SchAI Benchmark
电子设计智能体评测
引言
SchAI 开展 Benchmark,旨在评估电子设计智能体从需求或参考资料出发,完成实际工程任务的能力,并为产品改进提供可追溯的依据。评测对象是 Agent 的完整执行过程:理解输入资料、调用设计工具、组织器件与网络,以及形成可编辑、可检查的工程产物。自然语言回答是否合理、图面是否整齐,只能反映其中一部分;器件定义、参数配置和连接关系是否满足任务要求,同样需要检查。
评测按工作目标划分为四类任务。自主设计考察开放式需求下的方案构建与模块协调;电路复原考察对参考图、器件参数和网络拓扑的准确恢复;自动建库考察从手册到符号、引脚定义及封装映射的结构化转换;电路诊断考察已有设计中的问题定位、原因解释与误报控制。四类任务分别评价,使整体表现与具体能力边界能够同时被观察,而不以某一类任务的成绩代表全部电子设计能力。
任务复杂度从规模、模块数量、跨模块依赖、约束复杂度和推理深度五个方面判断,并在执行前确定 Easy、Medium 或 Hard 等级。评测保留任务输入、实际执行记录、最终产物和检查记录,将执行状态与验收结论分开:正常结束说明流程完成,只有该任务版本的全部必选验收条件得到满足,才能判定案例通过。难度不随单次运行成败调整,也不用于额外加权综合评分。
结果从产物质量与执行效率两个方面呈现。当前质量指标为人工综合展示评分,用于概括现有产物的整体效果,并非统一量化量表计算的实测分数,也不替代逐案例验收。平均耗时、模型调用轮次及输入和输出 Token 描述执行开销,缓存命中率描述输入上下文的复用情况。轮次更少或缓存率更高,不直接意味着电路更正确;这些指标应结合任务目标与最终产物共同解读。
任务分类与难度分级
四类任务按照主要工作目标划分,其输入、输出与验收要求不同。原理图任务中顺带创建器件库,仍归入原任务类型,不重复计为独立建库案例;电路诊断只评价问题识别与解释,不评价自动修复。
| 任务类型 | 为什么评测 | 重点看什么 |
|---|---|---|
| 自主设计 | 判断能否把需求变成完整电路 | 功能完整性、器件选择、模块连接 |
| 电路复原 | 判断能否准确理解参考电路 | 器件参数、极性、网络关系 |
| 自动建库 | 判断能否将器件资料转成可用符号 | 引脚完整性、编号与名称、封装映射 |
| 电路诊断 | 判断能否发现并解释已有问题 | 故障定位、原因分析、正常电路误报 |
任务从 Easy 的局部理解与执行,延伸到 Medium 的模块关联,再到 Hard 的跨模块推理与多约束决策。难度依据输入和验收要求提前确定,不随单次成败调整,也不作为评分的额外权重。
| 任务类型 | Easy | Medium | Hard |
|---|---|---|---|
| 自主设计 | 单模块、明确需求 | 多模块供电与接口协同 | 完整系统、多约束设计 |
| 电路复原 | 清晰图像、单模块 | 密集图面、跨区域连接 | 大型跨页电路复原 |
| 自动建库 | 少引脚、直接映射 | 多引脚、功能复用 | 复杂封装、多单元映射 |
| 电路诊断 | 单一明显局部问题 | 多种可能原因排查 | 多问题耦合、跨模块分析 |
评测结果
四类任务分别评价,呈现当前产物的整体效果与完成任务所需的平均时间。
| 任务类型 | 综合评分 / 100 | 平均耗时 | 平均 Loop 轮次 | 缓存命中率 | 平均输入 Token | 平均输出 Token |
|---|---|---|---|---|---|---|
| 自主设计 | 85 | 13分48秒 | 25.3 | 94.1% | 1,786,336 | 22,801 |
| 电路复原 | 95 | 2分16秒 | 8.7 | 87.8% | 197,053 | 3,792 |
| 自动建库 | 100 | 1分27秒 | 7.0 | 84.5% | 197,342 | 2,440 |
| 电路诊断 | 95 | 27秒 | 4.3 | 88.8% | 42,655 | 479 |
Loop 轮次指每次任务的模型调用轮数;Token 为任务内各轮调用的累计量,输入包含缓存命中部分。缓存命中率按缓存命中 Token 总量占输入 Token 总量计算。
综合评分来自人工对当前产物的评价,不代表案例通过率;平均耗时来自已有运行记录。结果以工程产物与检查记录为依据,不代表实物验证。
结论
当前结果表明,SchAI 已能产出多模块、可编辑的原理图,但自主设计仍是主要改进方向。开放式需求要求同时处理功能划分、器件选择、参数配置和跨模块约束,现有方案在完整性与细节一致性上仍需工程师审查。自主设计的平均模型调用轮次和 Token 开销也明显高于其他类别,说明当前执行过程需要更多轮交互与上下文处理;这些开销本身不能证明方案更充分,也不能代替对设计正确性的判断。
对于具有明确参考资料的任务,现有产物表现更为成熟。芯片手册中的典型应用电路提供了器件、参数及连接依据,器件资料则为引脚编号、名称和封装映射提供了核对基础。当前电路复原综合评分为 95 分,自动建库为 100 分,支持将“手册到可编辑电路”和器件建库作为现阶段工程辅助的重点应用方向。建库的 100 分是本次评测范围内的综合评价,不表示任意器件、封装或工业场景均能达到百分之百正确率。
电路诊断已经能够定位常见的连接、极性和参数问题,并解释其可能影响,适合辅助工程师开展初步检查。不过,发现已知故障与排除所有潜在问题是不同的要求。后续仍需分别检查故障漏报、正常电路误报,以及多问题耦合时的根因分析能力;当前结果只涉及诊断,不包含自动修复能力,也不替代完整工程审核或实物验证。
总体而言,SchAI 现阶段适合作为工程师的设计辅助工具,承担资料整理、参考电路复原、器件建库和初步诊断,并为自主设计提供可继续修改的工程起点。后续评测应进一步补齐逐案例验收与重复运行记录,重点检验复杂任务的正确性、不同运行之间的稳定性,以及在保持产物质量前提下降低执行开销的效果。随着证据积累,再逐步形成更明确的能力结论与适用范围。