公司在没有一致基准测试的情况下评估 LLM 会浪费资源。构建一个全面的测试框架,用于衡量跨不同任务和领域的性能。AI 团队会为可靠的比较数据付费。从基本的文本生成任务开始,然后再扩展。最大的风险是模型提供商操纵基准测试。