AI 训练集群具有 TCP 处理不佳的独特网络模式——小消息、大量并行连接以及对某些数据丢失的容忍度。
开发一种基于 UDP 的协议,具有 ML 特定的拥塞控制和消息批处理。将其打包为 PyTorch/TensorFlow 的即插即用库。
销售给云提供商和运行大型训练作业的企业。核心开源,提供付费管理工具。
MVP 是一个基本的 Python 库,可在基准测试中显示吞吐量改进。
风险在于大型公司首先开发内部解决方案。
构建优于 TCP、专为 AI 集群流量设计的替代方案。服务于运行大规模分布式 ML 训练的团队。
新研究表明 TCP 在 AI 规模下存在瓶颈,催生了对替代方案的需求。
AI 训练集群具有 TCP 处理不佳的独特网络模式——小消息、大量并行连接以及对某些数据丢失的容忍度。
开发一种基于 UDP 的协议,具有 ML 特定的拥塞控制和消息批处理。将其打包为 PyTorch/TensorFlow 的即插即用库。
销售给云提供商和运行大型训练作业的企业。核心开源,提供付费管理工具。
MVP 是一个基本的 Python 库,可在基准测试中显示吞吐量改进。
风险在于大型公司首先开发内部解决方案。