公司希望使用开源 LLM,但缺乏关于它们在特定用例(如支持工单或合同审查)中表现的可靠数据。
创建一个持续更新的服务,让新模型通过标准化的业务场景(电子邮件起草、代码审查等)进行测试,并进行盲评。
通过企业报告盈利,详细说明哪些模型适用于哪些行业。
MVP:在 5 种任务类型上比较 3 个主流开源模型。
风险:模型提供商可能会操纵基准测试。
标准化测试套件,将开源 LLM 与商业产品在实际业务任务上进行比较,而不仅仅是学术基准。
随着每周都有数十个新的开源模型发布,团队需要实际的性能比较。
公司希望使用开源 LLM,但缺乏关于它们在特定用例(如支持工单或合同审查)中表现的可靠数据。
创建一个持续更新的服务,让新模型通过标准化的业务场景(电子邮件起草、代码审查等)进行测试,并进行盲评。
通过企业报告盈利,详细说明哪些模型适用于哪些行业。
MVP:在 5 种任务类型上比较 3 个主流开源模型。
风险:模型提供商可能会操纵基准测试。