【导读】大模型训练与高并发推理场景下,AI集群网络瓶颈已从传统链路传输,下沉至网卡内部的状态管理、队列调度与可靠传输等底层环节。传统RDMA RoCE网卡依赖细粒度连接状态管理的架构,在GPU规模与并行通信度大幅提升时,会出现片上资源压力激增、调度失衡、有效带宽损耗等问题,严重制约AI集群算力释放。9月4日,天津大学-凌波智芯先进算力互联技术联合实验室在天津大学正式成立。联合实验室聚焦人工智能算力互联,将围绕高性能 AI 网卡、Scale-out 网络、无链接 RoCE、先进流量控制、高并发状态管理和可靠传输等方向开展联合攻关。
当 AI 集群进入高并发、强同步的训练与推理阶段,网络问题已经逐步下沉到网卡内部的数据通路、连接状态组织、队列调度、拥塞反馈、可靠传输和片上资源利用。对于大模型训练,Collective 通信的完成时间直接影响每一轮迭代;对于推理,专家并行、跨节点 KV 数据交换和请求突发会进一步放大网络长尾。
传统面向连接的 RDMA 网卡通常以 QP 及其关联上下文作为传输和可靠性管理的重要粒度。一个通信关系背后,需要维护序列号、窗口、重传、拥塞控制以及队列等状态。当 GPU 数量、并发通信关系以及 Collective 并行度同时上升时,状态项数量、查表频率和片上 SRAM 压力会快速放大。只要其中任一环节出现访问冲突、缓存不命中或调度失衡,都可能把物理链路的理论带宽转化为实际有效带宽损失。
凌波智芯围绕这一问题研发 LINGBO 系列高性能 AI 网卡,并提出“无链接 RoCE”技术路线。其核心并不是简单提高 SerDes 速率,也不是把现有 RoCE 逻辑原样搬到更高速芯片上,而是在保持 RoCEv2 和开放以太网基础生态的前提下,重新设计网卡内部通信状态、队列与可靠传输机制,让网卡在高并发 AI 通信下仍能维持高效的数据面处理。
所谓“无链接 RoCE”,并不是取消 RDMA 的可靠性语义,也不是让数据包无序、无状态地在网络中自由发送,而是把数据传输从大量细粒度连接上下文中解耦。凌波智芯采用面向目的端的状态聚合思路,使同一目的端的多条通信流能够共享部分传输上下文和调度资源,降低连接数量增长对片上存储和状态访问带来的压力。
在数据面上,网卡首先识别报文类型和目的端,将数据流映射到对应的目的端队列或调度实体;控制报文与数据报文走不同处理路径,可靠性、流控和调度状态不再完全绑定到每一个独立通信关系。这样做的直接结果,是将大量细粒度状态操作收敛为更可聚合的目的端级或队列级管理,使硬件流水线更容易保持稳定的查表和调度节奏。
在流控方面,凌波智芯自研 HP4 流控将控制点前移到网卡侧。其核心思想是依据接收端可承载能力、网络往返特征和当前活跃发送关系,对可注入网络的数据量进行主动约束。凌波智芯不会公开 HP4 的具体阈值、状态位宽、Credit 编码方式和调度参数,但可以明确其工程价值:把拥塞管理从“事后退让”尽可能前移到“事前注入控制”,在开放以太网环境中降低突发拥塞、长尾和带宽波动。
在可靠传输方面,凌波智芯的 SSR 选择性重传采用 Packet Container 思想,把连续数据包组织成更适合硬件管理的报文容器。容器内部通过紧凑的接收状态记录哪些数据已经到达、哪些仍然缺失;接收端发现序列空洞后,通过选择性确认反馈缺失位置,发送端只重传真正丢失的数据,而不是重复发送已经正确到达的整个数据段。
从系统角度看,SSR 并不是一个孤立的“重传算法”,而是无链接 RoCE 可靠传输体系的一部分:无链接架构减少细粒度连接状态,SSR 负责以更紧凑的方式重建可靠性能力,两者共同解决“状态减少之后如何仍然保证 RDMA 可靠传输”的问题。
高性能 AI 网卡也并不是单一的 MAC 或 RDMA 协议模块,而是一条贯穿主机内存、PCIe、DMA、WQE/CQ、协议处理、队列调度、SerDes 和以太网链路的数据通路。凌波智芯并不把产品定义为“一个新的 RoCE 协议”,而是把无链接 RoCE 做成一套完整的网卡微架构,要求协议、状态表、队列、调度器、DMA、流控、重传、驱动和软件栈共同配合。
结论
天大-凌波智芯联合实验室的成立,精准瞄准大模型时代AI算力互联的底层技术短板,打破了传统RoCE网卡架构的性能桎梏。凌波智芯创新的无链接RoCE技术,通过状态聚合解耦通信连接、HP4前置式主动流控、SSR选择性重传三大核心技术,重构了网卡数据处理与传输逻辑,在兼容主流以太网生态的基础上,解决了高并发场景下片上资源紧张、网络拥塞、传输长尾等核心问题,实现AI网络传输效率的大幅提升。联合实验室将把高校在网络体系、拥塞控制和系统研究方面的原创成果,与企业在 FPGA、芯片 RTL、板卡、驱动和客户场景验证方面的工程能力连接起来,形成从论文原理到硬件 IP、再到产品和真实业务验证的完整闭环。凌波智芯创始人、天津大学教授李文信表示,LINGBO 系列 AI 网卡是现阶段技术落地的重要产品载体,但联合实验室长期希望沉淀的是协议、架构、算法、核心 IP 和系统能力。



