跳至正文
研究 / SchAI Benchmark

SchAI Benchmark

电子设计智能体评测

内容版本 v1.0综合评分预览

引言

SchAI 开展 Benchmark,旨在评估电子设计智能体从需求或参考资料出发,完成实际工程任务的能力,并为产品改进提供可追溯的依据。评测对象是 Agent 的完整执行过程:理解输入资料、调用设计工具、组织器件与网络,以及形成可编辑、可检查的工程产物。自然语言回答是否合理、图面是否整齐,只能反映其中一部分;器件定义、参数配置和连接关系是否满足任务要求,同样需要检查。

评测按工作目标划分为四类任务。自主设计考察开放式需求下的方案构建与模块协调;电路复原考察对参考图、器件参数和网络拓扑的准确恢复;自动建库考察从手册到符号、引脚定义及封装映射的结构化转换;电路诊断考察已有设计中的问题定位、原因解释与误报控制。四类任务分别评价,使整体表现与具体能力边界能够同时被观察,而不以某一类任务的成绩代表全部电子设计能力。

任务复杂度从规模、模块数量、跨模块依赖、约束复杂度和推理深度五个方面判断,并在执行前确定 Easy、Medium 或 Hard 等级。评测保留任务输入、实际执行记录、最终产物和检查记录,将执行状态与验收结论分开:正常结束说明流程完成,只有该任务版本的全部必选验收条件得到满足,才能判定案例通过。难度不随单次运行成败调整,也不用于额外加权综合评分。

结果从产物质量与执行效率两个方面呈现。当前质量指标为人工综合展示评分,用于概括现有产物的整体效果,并非统一量化量表计算的实测分数,也不替代逐案例验收。平均耗时、模型调用轮次及输入和输出 Token 描述执行开销,缓存命中率描述输入上下文的复用情况。轮次更少或缓存率更高,不直接意味着电路更正确;这些指标应结合任务目标与最终产物共同解读。

任务分类与难度分级

四类任务按照主要工作目标划分,其输入、输出与验收要求不同。原理图任务中顺带创建器件库,仍归入原任务类型,不重复计为独立建库案例;电路诊断只评价问题识别与解释,不评价自动修复。

四类任务为什么评测,以及重点看什么
任务类型为什么评测重点看什么
自主设计判断能否把需求变成完整电路功能完整性、器件选择、模块连接
电路复原判断能否准确理解参考电路器件参数、极性、网络关系
自动建库判断能否将器件资料转成可用符号引脚完整性、编号与名称、封装映射
电路诊断判断能否发现并解释已有问题故障定位、原因分析、正常电路误报

任务从 Easy 的局部理解与执行,延伸到 Medium 的模块关联,再到 Hard 的跨模块推理与多约束决策。难度依据输入和验收要求提前确定,不随单次成败调整,也不作为评分的额外权重。

各类任务的 Easy、Medium、Hard 分级依据
任务类型EasyMediumHard
自主设计单模块、明确需求多模块供电与接口协同完整系统、多约束设计
电路复原清晰图像、单模块密集图面、跨区域连接大型跨页电路复原
自动建库少引脚、直接映射多引脚、功能复用复杂封装、多单元映射
电路诊断单一明显局部问题多种可能原因排查多问题耦合、跨模块分析

评测结果

四类任务分别评价,呈现当前产物的整体效果与完成任务所需的平均时间。

SchAI 四类任务的人工综合评分、耗时与执行指标
任务类型综合评分 / 100平均耗时平均 Loop 轮次缓存命中率平均输入 Token平均输出 Token
自主设计8513分48秒25.394.1%1,786,33622,801
电路复原952分16秒8.787.8%197,0533,792
自动建库1001分27秒7.084.5%197,3422,440
电路诊断9527秒4.388.8%42,655479

Loop 轮次指每次任务的模型调用轮数;Token 为任务内各轮调用的累计量,输入包含缓存命中部分。缓存命中率按缓存命中 Token 总量占输入 Token 总量计算。

综合评分来自人工对当前产物的评价,不代表案例通过率;平均耗时来自已有运行记录。结果以工程产物与检查记录为依据,不代表实物验证。

结论

当前结果表明,SchAI 已能产出多模块、可编辑的原理图,但自主设计仍是主要改进方向。开放式需求要求同时处理功能划分、器件选择、参数配置和跨模块约束,现有方案在完整性与细节一致性上仍需工程师审查。自主设计的平均模型调用轮次和 Token 开销也明显高于其他类别,说明当前执行过程需要更多轮交互与上下文处理;这些开销本身不能证明方案更充分,也不能代替对设计正确性的判断。

对于具有明确参考资料的任务,现有产物表现更为成熟。芯片手册中的典型应用电路提供了器件、参数及连接依据,器件资料则为引脚编号、名称和封装映射提供了核对基础。当前电路复原综合评分为 95 分,自动建库为 100 分,支持将“手册到可编辑电路”和器件建库作为现阶段工程辅助的重点应用方向。建库的 100 分是本次评测范围内的综合评价,不表示任意器件、封装或工业场景均能达到百分之百正确率。

电路诊断已经能够定位常见的连接、极性和参数问题,并解释其可能影响,适合辅助工程师开展初步检查。不过,发现已知故障与排除所有潜在问题是不同的要求。后续仍需分别检查故障漏报、正常电路误报,以及多问题耦合时的根因分析能力;当前结果只涉及诊断,不包含自动修复能力,也不替代完整工程审核或实物验证。

总体而言,SchAI 现阶段适合作为工程师的设计辅助工具,承担资料整理、参考电路复原、器件建库和初步诊断,并为自主设计提供可继续修改的工程起点。后续评测应进一步补齐逐案例验收与重复运行记录,重点检验复杂任务的正确性、不同运行之间的稳定性,以及在保持产物质量前提下降低执行开销的效果。随着证据积累,再逐步形成更明确的能力结论与适用范围。

SchAI Benchmark返回顶部 ↑