ML 团队缺乏关于不同 MoE 配置在各项任务上性能的集中数据。
一个对新 MoE 版本运行标准化基准测试的平台将有助于模型选择。
工程团队将为访问比较数据付费。
首先针对常见 NLP 任务测试开源模型。
最大风险:维护测试基础设施的成本。
构建一个平台,对比专家混合(MoE)模型的性能。面向 ML 工程师。
MoE 架构的激增产生了对客观基准测试的需求。
ML 团队缺乏关于不同 MoE 配置在各项任务上性能的集中数据。
一个对新 MoE 版本运行标准化基准测试的平台将有助于模型选择。
工程团队将为访问比较数据付费。
首先针对常见 NLP 任务测试开源模型。
最大风险:维护测试基础设施的成本。