Desert Ant Labs

Toxic:设备端多语言仇恨言论检测

内容审核封闭测试

设备端多标签分类器,覆盖英语、西班牙语、葡萄牙语、法语、德语、意大利语、波兰语和荷兰语,标记仇恨、骚扰、威胁、性相关和自残内容,让存疑文本在离开设备之前就完成初筛。

Toxic是一个设备端多标签分类器,覆盖八种语言(英语、西班牙语、葡萄牙语、法语、德语、意大利语、波兰语、荷兰语)的仇恨言论、骚扰、威胁、性骚扰和自残内容。当仇恨检测头触发时,十个目标检测头会判断文本针对哪一类受保护群体:种族、肤色、宗教、出身、民族或族裔来源、性取向、性别、残障、年龄或其他。

它的优势在于以小博大。在七种欧盟语言上,Toxic的宏平均F1比Llama-Guard-3-1B和Qwen3Guard-Gen-0.6B高出13到17个百分点,比Detoxify高30个百分点,磁盘占用仅为其一小部分(75.5 MB LiteRT,66.7 MB Core ML,而各守卫模型构建大约在500 MB到1 GB之间)。训练数据在商业上是干净的(仅CC0、CC-BY、MIT、Apache-2.0),因此可以直接发布到产品中,而无需承担抓取仇恨言论语料带来的授权风险。

Toxic目前处于封闭测试阶段。 模型卡与权重已公开。可申请抢先体验。

性能

在七种欧盟语言上,宏平均F1比Llama-Guard-3-1B和Qwen3Guard-Gen-0.6B高出13到17个百分点,而体积只有它们的六分之一到十四分之一:75.5 MB LiteRT对比守卫模型构建的500 MB到1 GB。

0.786
宏平均F1
0.881
仇恨召回率
66.7 MB
设备端
2.82 ms
每次前向

在同一套HateCheck评测流程下、阈值0.40时的宏平均F1(内部数据)。7-EU列是西班牙语、葡萄牙语、法语、德语、意大利语、波兰语和荷兰语的平均值。Toxic在8种语言中的7种全面胜出;只有英语上由Llama-Guard领先。

模型7-EU F1EN F1体积
Toxic (LiteRT int4)0.7860.78775.5 MB
Toxic (Core ML 4-bit)0.7770.77166.7 MB
Qwen3Guard-Gen-0.6B (bf16)0.6520.770server
Llama-Guard-3-1B (bf16)0.6490.814server
Llama-Guard-3-1B (int4)0.6330.794955 MB
Qwen3Guard-Gen-0.6B (int4)0.6220.750484 MB
Detoxify multilingual (fp32)0.4870.642~280 MB

在HateCheck测试集上的内部评估(每种语言约3,700条人工撰写用例),从未用于训练。对比模型经同一套评测流程重新运行。

应用场景

消息发送前初筛

在消息离开手机之前,就在设备上对外发消息打分,让仇恨、威胁或骚扰内容触发行内提示或复核流程,完全不必经过你的服务器。

无服务器的评论初筛

在客户端本地用Toxic处理每一条收到的评论,把疑似仇恨言论送入审核队列,只把被标记的文本升级给人工。这样可以减少集中审核的量,而不必为每条消息发起一次云端调用。

把自残和威胁信号引导至求助资源

自残和威胁检测头独立于仇恨检测头,因此客户端可以呈现危机干预资源或升级路径,而不会把这两类信号与仇恨混为一谈。

一个模型覆盖八种语言

单一的75 MB制品覆盖英语、西班牙语、葡萄牙语、法语、德语、意大利语、波兰语和荷兰语。一次集成搞定八种语言,无需按语言构建流水线,也无需单独的语种检测步骤。

功能

  • 五个多标签内容检测头:仇恨、骚扰、威胁、性相关、自残。
  • 在仇恨检测头之上的十个目标检测头:种族、肤色、宗教、出身、民族或族裔来源、性取向、性别、残障、年龄、其他。
  • 单一制品覆盖八种语言:英语、西班牙语、葡萄牙语、法语、德语、意大利语、波兰语、荷兰语。按语言的阈值表随模型元数据一同发布。
  • 仅在宽松授权的语料上训练(CC0、CC-BY、MIT、Apache-2.0),因此可以直接发布在商业产品中。
  • 完全在设备上运行:66.7 MB Core ML(4-bit,面向Apple Neural Engine优化)或75.5 MB LiteRT(int4 blockwise-32)。

规格

语言
8种:英语、西班牙语、葡萄牙语、法语、德语、意大利语、波兰语、荷兰语
设备端体积
66.7 MB Core ML(4-bit);75.5 MB LiteRT(int4 blockwise-32)
骨干网络
XLM-R-base,精简后的60,728词表,12层,隐藏维度768,约133M参数
准确度
8种语言宏平均F1为0.786(LiteRT int4),0.777(Core ML 4-bit)

它是内容审核的初筛工具,而非最终判定:将标记结果交给人工复核或更重的本地分层处理,而不是自动删除。在对抗性测试下,Toxic会在相当一部分情况下把反歧视言论、含否定的仇恨表达、被弱势群体重新占用的贬称,以及简短的身份提及误判为仇恨,尤其是英语和德语。对于荷兰语、德语和波兰语,建议搭配一份按语言的贬称词表,以捕捉它遗漏的直接贬称。

常见问题

Toxic是什么?

设备端多标签分类器,覆盖英语、西班牙语、葡萄牙语、法语、德语、意大利语、波兰语和荷兰语,标记仇恨、骚扰、威胁、性相关和自残内容,让存疑文本在离开设备之前就完成初筛。

Toxic在设备上运行吗?

是的。Toxic完全在设备上运行:推理在本地完成,不调用任何服务器,因此数据不会离开设备。

Toxic现在可用了吗?

Toxic目前处于封闭测试阶段。你可以在其页面上申请抢先体验。

Toxic的价格是多少?

每个模型的每个SDK均可免费支持最多10万台月活跃设备。每位用户可无限次推理。 如需定制授权,请联系我们

Toxic的准确度和速度如何?

在七种欧盟语言上,宏平均F1比Llama-Guard-3-1B和Qwen3Guard-Gen-0.6B高出13到17个百分点,而体积只有它们的六分之一到十四分之一:75.5 MB LiteRT对比守卫模型构建的500 MB到1 GB。

抢先体验

告诉我们你正在开发什么,我们会帮你把一切准备就绪。