这里记录工程验证过程:做了什么、跑到了哪一步,还有哪些问题没回答。
双 MAC 点积已通过 AXI DMA 在实际 Zynq 板卡上完成批量测试。1024 维、批量 256 时,PL 平均每个向量 5.838 μs,比同批量 NumPy 快 2.51 倍。
把现有系统、资料和使用方式写在邮件里,我们先判断是否值得做。