凌波智芯联合天津大学成立实验室,聚焦 AI 集群互联效率

凌波智芯联合天津大学成立实验室,聚焦 AI 集群互联效率

天津大学—凌波智芯先进算力互联技术联合实验室揭牌仪式

近日,天津大学-凌波智芯先进算力互联技术联合实验室在天津大学正式成立。这个联合实验室聚焦人工智能算力互联,将围绕高性能 AI 网卡、Scale-out 网络、无链接 RoCE、先进流量控制、高并发状态管理和可靠传输等方向开展联合攻关。

这件事可以用更简单的话理解:AI 集群里有很多 GPU,GPU 负责计算,但 GPU 之间也要不停传数据。当 AI 集群进入高并发、强同步的训练与推理阶段,网络问题已经不再只是“端口带宽够不够”,而是会影响 GPU 有效利用率和系统吞吐。

大模型训练时,很多 GPU 要在每一轮计算后同步信息,其中 Collective 通信的完成时间会直接影响每一轮迭代。推理阶段也有类似问题,比如专家并行、跨节点 KV 数据交换和请求突发,会进一步放大网络长尾。

凌波智芯做的,就是围绕这些 AI 集群里的网络互联问题研发 LINGBO 系列高性能 AI 网卡。公司提出的“无链接 RoCE”技术路线,并不是取消可靠传输,而是把数据传输从大量细粒度连接上下文中解耦。通俗地说,就是不要让网卡为每一条细碎通信关系都重复背负过多状态,而是把部分状态按目的端或队列进行聚合管理。

凌波智芯还围绕这一架构设计了 HP4 流控和 SSR 选择性重传。HP4 的思路是在数据进入网络之前,就依据接收端可承载能力、网络往返特征和当前活跃发送关系,控制可注入网络的数据量。SSR 的思路是,如果传输中有数据缺失,就通过选择性确认反馈缺失位置,让发送端只重传真正丢失的数据,而不是把已经正确到达的数据也重复发送。

所以,这个项目的核心不是简单讲“网卡带宽更高”,而是讲 AI 集群规模变大之后,网卡内部的数据通路、连接状态、队列调度、流控和重传都会影响 GPU 的有效利用率。凌波智芯希望通过无链接 RoCE、HP4 流控、SSR 选择性重传和完整网卡微架构,让 AI 集群减少通信等待,提高训练和推理效率。

联合实验室的作用,是把网络论文、硬件 IP 和真实集群验证连起来。联合实验室将把高校在网络体系、拥塞控制和系统研究方面的原创成果,与企业在 FPGA、芯片 RTL、板卡、驱动和客户场景验证方面的工程能力连接起来,形成从论文原理到硬件 IP、再到产品和真实业务验证的完整闭环。

同日,天津大学与凌波智芯签署相关入股增资协议,双方合作由联合科研进一步延伸到成果转化和产业协同。凌波智芯创始人、天津大学教授李文信表示,LINGBO 系列 AI 网卡是现阶段技术落地的重要产品载体,但联合实验室长期希望沉淀的是协议、架构、算法、核心 IP 和系统能力。

后续在客户 POC 阶段,还需要进一步覆盖主流 GPU、交换机、训练框架和不同拓扑,验证软硬件互操作性,以及新网卡与现有 RoCE 网络混合部署时的兼容能力。这也意味着,真实多节点网络中的有效带宽、Collective 完成时间、P99 尾时延、丢包恢复时间和规模扩展效率,将成为继续观察这一技术工程化进展的重要指标。

本文来自投稿,不代表增长黑客立场,如若转载,请注明出处:https://www.growthhk.cn/cgo/model/169701.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
在HYROX,排泄物比一滴水更合规?
上一篇 4小时前
首搭AI超级智能体迪迪虾,腾势N8L纯电上市29.98万元起
下一篇 3小时前

增长黑客Growthhk.cn荐读更多>>

发表回复

登录后才能评论