随着 AI 模型越来越复杂,它们的推理有时会产生训练期间未预料到的危险输出。当前的测试方法可能会错过这些极端情况,直到为时已晚。
构建一个 API 或 IDE 插件,根据已知的风险模式(如不安全逻辑跳跃或隐藏偏见)来分析 AI 输出。它将在开发和测试期间标记出令人担忧的响应。
部署 LLM 的 AI 开发者和企业团队会为此付费,以规避声誉损害和合规失败的风险。
首先创建一个简单的 Web 界面,用户可以在其中粘贴模型输出,以根据已知的有问题的模式的基本规则集进行检查。
最大的风险在于,随着模型的不断发展,检测规则需要保持足够全面,这需要不断更新。