这个开源项目非常知名(https://github.com/corundum/corundum),国内也有很多学者业内人士写过不少文章,我也都认真拜读过。以前手里有Bittware XUP-P3R的时候就在上面测试过(25g版本),不得不说质量非常高,在那时候就感叹作者Alex Forencich的开源精神,并且他还在油管上专门录视频讲解。但是因为Bittware XUP-P3R这款开发板本身项目就支持,我也就没研究过如何将这个项目移植/适配到新的开发板上,尤其是100g版本。正好手头有Bittware XUP-VV4这款开发板xcvu13p的芯片,同时有四个qsfp28接口,正好能满足100g版本的移植以及测试。
这篇文章不会详细讲如何一步一步移植(或许会放在后续文章中来讲),而是我想先把我在移植过程中碰到的值得记录的点讲出来,我感觉这个比移植本身要更有价值,毕竟改改管脚约束没啥大的分享价值。
首先,我先给出生成bitstream文件后的物理布局布线图,如下图。
乍一看去绿油油一大片,并且可以发现这些绿色区域还挺有规律,仿佛被分割了一样分成几块。似乎使用了很多LUT资源,但是我们再看接下来的图
其实使用的片上资源不多,尤其是LUT才用了7%。同时我们看下WNS仅有0.004ns,差一点就时序违例。接下来我们再看下时序报告部分。
逻辑级数几乎为0,所以时序紧张并不是因为组合逻辑过重导致的,那这是为啥呢?这就引出来一个平时在开发中很少遇到的情况就是跨片走线。
我再放一张xcvu13p的芯片图示
从xcvu13p芯片的示意图上我们可以发现有三条紫红色的分割区域写着SLR Crossing,SLR是啥呢?就是超级逻辑区(Super Logic Region),就是一个芯片不是一整块硅片而是好几块小硅片叠成一个芯片,这些小硅片之间通过中介层连接在一起互通起来,那你想啊如果两个功能模块或者两个信号他都不是一个硅片上的,那要串门子那肯定绕路啊,表现到时序上就是跨硅片的电路延迟高。
再回过头来看我手里这块开发板Bittware XUP-VV4,根据硬件手册所示:qsfp_0和qsfp_1在SLR3中;qsfp_2和qsfp_3在SLR2中;pcie则在SLR1中。在这种情况下跨SLR的布线就是最大的延迟来源,我们平时不怎么关注的pblock规划就显得非常重要了。
接下来我简要讲下移植步骤,corundum项目中不同的板卡工程都在corundum\fpga\mqnic目录下。因为我们要实现100g版本,所以最好的方案就是找个类似的复制一份如下图,我复制了VCU118这个工程,改成VV4。
接下来看顶层模块接口信号以及约束文件,具体的根据原理图或者硬件手册去修改管脚就不细说(因为真的就是改管脚约束)。这里注意的是DDR4并不是核心功能必须的,即使是板子上没有DDR4也没关系。
整个移植过程中最费功夫的是placement.xdc文件的修改,因为最开始没在意以为没啥问题,结果时序过不了。只能回过头改pblock来约束模块布局。最后调整完毕的一个布局规划如下:
# Placement constraints # VV4 / xcvu13p-figd2104 # PCIe GTY 224-227 -> SLR1, CR X7Y4-Y7 # QSFP3 GTY 228 -> SLR2, CR X7Y8, CMACE4_X0Y6 # QSFP2 GTY 229 -> SLR2, CR X7Y9, CMACE4_X0Y7 # QSFP1 GTY 232 -> SLR3, CR X7Y12, CMACE4_X0Y9 # QSFP0 GTY 233 -> SLR3, CR X7Y13, CMACE4_X0Y10 # Split eth pblocks by SLR so CMAC txusrclk paths (e.g. tx_cpl_fifo) stay in-SLR.最终被几次漫长编译折磨后才勉强满足时序。
以上是我在移植corundum的过程中遇到的问题的一个总结,后续对corundum继续深挖和上板测试后会继续写相关的文章,如果大家有其他问题留言或者私信我即可。