OpenAI Moderation API
OpenAI Moderation API 是面向生成式 AI、模型、RAG 或 Agent 风险控制的 AI 安全工具。
分类:模型原生内容安全 API
公司 / 团队:OpenAI
详细介绍
该工具的主要能力包括文本与图片内容分类、风险类别评分、输入输出审核、omni-moderation 模型和 API 集成。
AI 安全工具的真实效果取决于模型、语言、攻击方法、上下文长度、输入模态、系统提示、RAG 数据、工具权限、部署位置、阈值、规则、版本和业务容错。详情页应把防护位置、风险类型、模态、动作、API、延迟、部署方式、数据处理、日志、评测结果和产品状态拆成动态字段维护。
适合场景
- 聊天输入审核
- 模型输出审核
- 图片内容审核
- 社区与 UGC 风险控制
- API 级安全策略
使用注意
- Moderation 主要处理内容风险,不能单独防御提示词注入、越权工具调用或数据外泄
- 类别、阈值和模型版本应按业务独立校准
- 高风险决定应保留人工复核和申诉流程
- 上线前应建立正常样本、边界样本、已知攻击、未知变体、跨语言、多模态和故障场景测试集,并完成权限审查、红队、安全评审、日志、回滚和应急预案。