本地运行 LLM 的开发者缺乏一致的方法来比较不同硬件上的模型。一套基准测试可以衡量常见任务的 tokens/秒、内存使用量和质量。
作为开源提供,并提供付费的详细比较。从常见设置上的基本速度测试开始。
风险:硬件/模型快速过时。
为本地运行的大型语言模型创建标准化测试。
更强大的本地模型需要实际的性能指标。
本地运行 LLM 的开发者缺乏一致的方法来比较不同硬件上的模型。一套基准测试可以衡量常见任务的 tokens/秒、内存使用量和质量。
作为开源提供,并提供付费的详细比较。从常见设置上的基本速度测试开始。
风险:硬件/模型快速过时。