研究人员缺乏系统性地检测 LLM 输出是否受模型自身训练数据影响而非外部输入的工具。这会带来反馈循环的风险。
构建一个分析工具,用于估算在不同提示策略下 LLM 输出的自我指涉程度。包含潜在递归模式的可视化。
AI 安全研究人员和负责任的部署团队愿意为更好的内省能力付费。
从一个在已知自我指涉示例上训练的简单分类器开始。
挑战在于为本质上模糊的事物定义有意义的指标。
识别 LLM 输出可能源自其自身训练数据的工具。
随着 LLM 生成更多内容,理解其自我指涉倾向对研究人员和开发者至关重要。
研究人员缺乏系统性地检测 LLM 输出是否受模型自身训练数据影响而非外部输入的工具。这会带来反馈循环的风险。
构建一个分析工具,用于估算在不同提示策略下 LLM 输出的自我指涉程度。包含潜在递归模式的可视化。
AI 安全研究人员和负责任的部署团队愿意为更好的内省能力付费。
从一个在已知自我指涉示例上训练的简单分类器开始。
挑战在于为本质上模糊的事物定义有意义的指标。