BTTF:面向芯片设计验证智能体系统的EDA基础设施重构方案
原文网页:https://arxiv.org/html/2610.06790v1
PDF链接:https://arxiv.org/pdf/2610.06790v1
arXiv编号:arXiv:2610.06790v1 [cs.AI],提交日期:2026‑10‑05
摘要
现代人工智能巨大算力建立在数十亿晶体管规模的复杂片上系统(SoC)之上,但芯片验证工作流至今仍然高度依赖人工操作。尽管大语言模型在电子设计自动化(EDA)领域发展迅速,但现有约74.6%的相关研究集中在静态寄存器传输级(RTL)代码生成,后仿真验证、交互式波形调试方向的研究存在大量空白。
本文提出BTTF(Back‑to‑the‑Future)端到端智能体框架,填补这项基础设施层面的技术缺口。BTTF将海量非结构化仿真转储文件提炼、归一化为关系型SQLite数据库,搭配协同式多智能体编排引擎;可以将自然语言验证查询转换为符合数据库范式的SQL语句,并将信号异常与版本化RTL代码仓库做关联分析。在包含150条专家标注查询的评测基准上,BTTF实现95.33%执行准确率,为实现自主EDA芯片验证提供可行技术路径。
关键词
电子设计自动化EDA;芯片验证;波形调试;多智能体;文本转SQL;RTL;仿真波形;数据库基础设施
目录
- 引言
- 相关工作
- BTTF整体框架
- 3.1 波形预处理流水线
- 3.2 大模型驱动多智能体编排引擎
- 实验结果
- 4.1 实验环境与评测基准
- 4.2 波形预处理压缩性能
- 4.3 框架整体任务准确率
- 4.4 单智能体 vs 多智能体架构对比
- 讨论与结论
- 参考文献
- 附录A 详细查询执行流程与输出样例
1 引言
摩尔定律逼近极限之后,AI算力持续增长高度依赖异构片上系统SoC。随着芯片架构复杂度持续提升,基于硬件描述语言HDL的设计流程迭代繁重、极易引入缺陷。验证环节占用芯片开发周期70%以上工时,是现代芯片设计的主要瓶颈;功能缺陷流入全芯片回归测试或者硅后测试,会带来指数级上升的资金与项目进度损失。因此RTL级验证与分析自动化,是EDA领域具备极高价值的研究目标。
大语言模型推动了大量AI辅助EDA研究,但研究方向分布极不均衡:约74.6%的LLM硬件相关研究聚焦前端RTL代码生成与综合;后仿真波形调试、动态验证方向研究严重不足。硬件开发既需要设计综合,同样离不开严苛测试,这就造成大量自动化潜力没有被挖掘。
少数已有的LLM辅助验证工作,几乎只处理静态源代码或者玩具规模仿真日志。而真实后仿真交互式调试是难度更高的任务:仿真出错后,工程师需要在波形查看工具中人工浏览TB级时序转储文件,逆向追踪非法信号跳变在HDL层级的原始根源。
原始波形数据会带来基础设施阻抗问题(Infrastructural Impedance):原始ASCII波形转储文件尺寸远超模型上下文窗口;没有结构化语义索引;不存在可供自主智能体调用的原生低延迟查询接口,大模型智能体无法直接接入该调试流程。
本文BTTF框架并不试图把海量波形全部塞进大模型上下文;而是复用经典EDA设计思想,将非结构化时序波形转换为归一化关系型SQLite数据库,再由协同多智能体引擎代表工程师完成规划、查询、审计整套验证工作。在150条专家标注查询测试集上,BTTF整体执行准确率95.33%;多智能体架构相比单体单智能体,五项综合质量审计得分提升17.3%。
本文主要贡献
- 指出芯片波形智能调试的核心瓶颈是数据基础设施阻抗,而非大模型推理能力本身。
- 设计BTTF端到端智能体框架:包含波形预处理流水线、多智能体编排引擎,把波形调试转化为LLM擅长的Text‑to‑SQL任务。
- 实现多种面向仿真波形的数据库压缩裁剪策略,在保留调试信息前提下大幅降低存储开销、查询延迟。
- 构建150条专家查询评测基准,实验验证BTTF在调试、信号分析、形式化SVA验证多类任务上的效果;多智能体分工带来显著质量收益。
2 相关工作
2.1 大模型驱动硬件验证
大模型已经被应用于缺陷定位、代码生成、自动化验证。前沿方案普遍采用多智能体编排,把硬件综合拆分为生成、Testbench仿真、形式化反例精炼等专用角色。但现有框架大多只作用于静态源代码、编译断言列表、小规模仿真日志,假设仅依靠静态HDL文本就可以定位功能错误。
VerilogCoder是最接近本方向的相关工作,提供基于抽象语法树AST的波形追踪工具,但仅适配小规模示例,无法处理工业级仿真转储。
2.2 Text‑to‑SQL技术
大模型具备很强的自然语言到结构化SQL的生成能力。一旦波形数据被组织为关系数据库,数据库成熟索引、聚合、过滤能力就可以直接为LLM智能体所用,这也是BTTF的核心设计思路。
3 BTTF整体框架
BTTF由两套耦合子系统组成,遵循统一关系模型契约:
- 离线波形预处理流水线:把庞大仿真转储文件压缩、处理,输出优化后的SQLite关系数据库
waves.db。 - 在线智能体编排引擎:接收自然语言验证查询,生成符合范式的SQL,完成整套验证分析。
3.1 波形预处理流水线
EDA仿真器输出专有二进制波形(.fsdb)或者ASCII格式值变更转储VCD文件;SoC模块原始VCD文件很容易超过10GB,无法直接送入模型上下文。
流水线提取目标层级,归一化存入SQLite,核心两张数据表:
signal_metadata:存储信号静态元信息(RTL信号名、变量类型等),分配唯一ID。signal_changes:记录时序行为,每条记录为(time, value),通过外键关联signal_metadata信号ID。
将信号静态属性和时序变化数据分开存储,智能体可以独立做结构推理与时序推理,查询需要的时候再做表连接。
简单直接把全部信号变更逐条入库会把存储压力从文件系统转移到数据库,BTTF采用多项优化策略:
- 时钟裁剪 Clock pruning:高频时钟翻转占数据库绝大部分体积,但调试信息价值很低;入库阶段直接跳过时钟跳变,不破坏时序时间锚点。
- 非活跃信号动态裁剪
ZERO策略:直接删除全程没有发生任何跳变的静态连线。AVG策略:额外删除跳变率低于全设计平均值的信号。
- 批量插入 Batched insertion:单行逐条写入SQLite会带来巨大事务开销;使用批量写入消除入库I/O瓶颈。
3.2 大模型驱动多智能体编排引擎
基于生成好的waves.db数据库,多智能体协同完成验证任务。
- 编排智能体 Orchestration Agent:接收自然语言查询,拆解子目标,分发给各个专用智能体;对合并后的结果做审计校验。
- 分析智能体 Analysis Agent:执行多查询SQL,完成模块范围探查、事件检查、信号跳变统计;支持迭代循环执行多轮查询,聚合多周期信号统计,例如功耗热点检测。
- 验证智能体 Verification Agent:关联波形异常与版本控制RTL源码;通过正则表达式执行SVA断言规则(
ASSERT/ASSERT_STATIC/ASSERT_NEVER/ASSERT_KNOWN/COVER)。 - 评估智能体 Evaluation Agent:在输出根因分析结果之前,从5个维度审计候选查询与输出:
- 正确性:过滤、聚合、表连接是否匹配用户意图;
- 完备性:是否包含全部需要字段、时间条件;
- 执行效率:索引使用合理,避免冗余表连接;
- 范式合规:严格遵守两张核心数据表schema;
- 上下文理解:正确解析仿真隐含时间尺度、模块层级作用域。
智能体之间只通过跨轮次动态会话上下文通信;查询失败时启用自纠错循环。断言校验失败时,智能体自动定位精确违规时间戳,定位造成故障的子信号,完成根因诊断。
4 实验结果
4.1 实验环境与评测基准
- 模型后端:Gemini‑2.5‑Pro API。
- 仿真数据集:多套复杂度不同SoC层级设计;原始VCD总大小4.2GB,合计18450根信号网表;仿真窗口从50ns毛刺调试短窗口到800ns完整事务仿真转储。
- 评测集:人工整理150条工程真实场景自然语言验证查询,每条配套专家标注标准答案。
任务分为三大类:调试Debugging、信号分析Analyzing、形式化验证Verification。
4.2 波形预处理压缩性能
| 裁剪策略 | 存储占用 | 压缩比例 | 查询平均延迟 | 有效跳变覆盖率 |
|---|---|---|---|---|
| 不做任何裁剪 | 1420 MB | 0.00% | 410.5 ms | 100.00% |
| 移除时钟 | 480 MB | 66.20% | 125.2 ms | 98.51% |
| ZERO‑无跳变信号裁剪 | 395 MB | 72.18% | 94.8 ms | 100.00% |
| AVG‑低于平均跳变率裁剪 | 185 MB | 86.97% | 41.6 ms | 64.23% |
- 仅移除时钟即可减少66.20%存储,查询延迟降低3.28倍,同时保留98.51%信号跳变调试信息。
- ZERO裁剪:删除全程无跳变信号,压缩72.18%,活跃信号覆盖率100%,属于安全可用方案。
- AVG激进裁剪压缩最高,但会损失35.77%覆盖率,是安全压缩的边界。
批量插入对比:相比单行写入,批量EXCUTEMANY入库最高获得2.89倍数据库生成加速,解决TB级波形入库I/O瓶颈。
4.3 框架整体任务准确率
| 任务大类 | 子任务类型 | 示例查询 | 准确率 |
|---|---|---|---|
| 调试 | 模块/信号范围探查 | 列出moduleA内部所有逻辑信号 | 100.00% |
| 调试 | RTL源码溯源 | 查找logicA对应的RTL源文件 | 87.50% |
| 调试 | 信号取值查看 | timeA时刻logicA信号值是多少 | 95.00% |
| 调试 | 信号跳变计数 | logicA一共发生多少次跳变 | 100.00% |
| 调试 | 事件时序检查 | net logicA第一次被置为valueA是什么时刻 | 100.00% |
| 信号分析 | 跳变覆盖率统计 | 计算jobA.db整体跳变覆盖率 | 91.67% |
| 信号分析 | 功耗热点定位 | 找出信号活跃度最高的100ns时间窗口 | 91.67% |
| 形式化验证 | 静态SVA规则校验 | 执行ASSERT_STATIC断言检查 | 84.62% |
| 形式化验证 | 动态SVA规则校验 | 执行ASSERT_KNOWN断言检查 | 90.91% |
全部150条查询综合执行准确率95.33%;基础调试类任务接近满分;复杂分析、形式化验证任务保持高可用准确率。
附录A表3提供完整示例:自然语言查询、智能体工具调用、输出结果样例。
4.4 单智能体 vs 多智能体架构对比
- 单体单智能体:响应原始速度更快;但是容易上下文信息杂乱、数据库schema幻觉,多跳验证因果追踪能力差;5项审计综合得分仅3.35 / 5.00。
- BTTF多智能体分工架构:SQL生成、RTL源码读取、结果评估解耦;综合质量得分提升17.3%,执行准确率接近满分;代价是平均延迟增加1.96倍。
在工业EDA生产流程中,为了无幻觉可靠验证,该延迟开销属于可接受的工程权衡。
5 讨论与结论
本文核心论点并且得到实验佐证:波形调试智能体的瓶颈是数据基础设施,而不是大模型本身能力。BTTF将TB级不透明波形转换为紧凑、厂商无关的关系数据库,把棘手的超长上下文问题,转化成熟的Text‑to‑SQL任务;编排引擎完成查询执行与可审计根因分析。
95.33%基准准确率,多智能体分工带来17.3%质量提升证明:自主EDA验证的实现路径,重点在于改善智能体与设计数据之间的接口,而不是单纯无限增大模型规模。
未来工作方向:
- 面向全芯片大规模设计,实现流式入库;标准化作用域路径归一化;完善波形‑RTL符号索引。
- 评测更大前沿推理模型,提升多跳因果追踪能力。
- 将该范式推广到回归日志、覆盖率数据库、功耗追踪等其它EDA工件。
BTTF不只是单点工具,更提供一套模板范式:把不透明EDA工件归一化为可查询存储,再交由专用智能体处理。希望社区把数据接口作为AI芯片设计方向的一等研究对象。
6 参考文献
完整参考文献查阅原始arXiv网页:https://arxiv.org/html/2610.06790v1
附录简要说明
- 附录A.1:断言失败自动根因诊断完整逻辑;违规时间戳定位、反向因果追踪流程。
- 附录A.2:完整端到端查询流水线,全部查询样例、工具调用、输出结果表。