目前在如何衡量或预测 AI 自我改进能力方面没有共识。
一个仪表盘,聚合已发布的基准测试,并针对模型 API 运行标准化测试。
销售给需要比较数据的 AI 实验室和安全研究人员。
MVP:在构建实时测试之前,对已发布模型进行静态报告。
风险:AI 发展的快速步伐可能使指标很快过时。
构建一个平台,跟踪和可视化 AI 模型之间的自我改进能力。帮助研究人员比较风险。
随着 AI 系统接近递归改进,该领域需要标准化的测量工具。
目前在如何衡量或预测 AI 自我改进能力方面没有共识。
一个仪表盘,聚合已发布的基准测试,并针对模型 API 运行标准化测试。
销售给需要比较数据的 AI 实验室和安全研究人员。
MVP:在构建实时测试之前,对已发布模型进行静态报告。
风险:AI 发展的快速步伐可能使指标很快过时。