Desert Ant Labs

Toxic: Flerspråkig hatpratsdetektion på enheten

InnehållsmodereringStängd beta

Flerspråkig klassificerare med flera etiketter på enheten som flaggar hatfullt, trakasserande, hotfullt, sexuellt och självskadande innehåll på engelska, spanska, portugisiska, franska, tyska, italienska, polska och nederländska, så att tveksam text kan sorteras innan den lämnar enheten.

Toxic är en klassificerare med flera etiketter på enheten för hatprat, trakasserier, hot, sexuella trakasserier och självskadebeteende på åtta språk: engelska, spanska, portugisiska, franska, tyska, italienska, polska och nederländska. När det hatfulla huvudet aktiveras identifierar tio målhuvuden vilken skyddad grund texten riktar sig mot: ras, hudfärg, religion, härkomst, nationellt eller etniskt ursprung, sexuell läggning, kön, funktionsnedsättning, ålder eller annat.

Fördelen är storlek mot kvalitet. Toxic slår Llama-Guard-3-1B och Qwen3Guard-Gen-0.6B med 13 till 17 makro-F1-poäng på de sju EU-språken, och Detoxify med 30, till en bråkdel av deras diskavtryck (75,5 MB LiteRT, 66,7 MB Core ML, mot ungefär 500 MB till 1 GB för guard-modellerna). Träningsdatan är kommersiellt ren (endast CC0, CC-BY, MIT, Apache-2.0), så den kan lanseras i en produkt utan licensexponeringen från skrapade hatpratskorpusar.

Toxic är i stängd beta. Modellkortet och vikterna är offentliga. Tidig åtkomst på begäran.

Prestanda

Slår Llama-Guard-3-1B och Qwen3Guard-Gen-0.6B med 13 till 17 makro-F1-poäng på de sju EU-språken, till en storlek som är 6 till 14 gånger mindre: 75,5 MB LiteRT mot 500 MB till 1 GB för guard-modellerna.

0,786
Makro-F1
0,881
Recall för hat
66,7 MB
På enheten
2,82 ms
Per framåtpassning

Makro-F1 vid tröskel 0,40 genom samma HateCheck-testrigg (internt). 7-EU-kolumnen är genomsnittet för spanska, portugisiska, franska, tyska, italienska, polska och nederländska. Toxic vinner direkt på 7 av 8 språk; Llama-Guard leder endast på engelska.

Modell7-EU F1EN F1Storlek
Toxic (LiteRT int4)0,7860,78775,5 MB
Toxic (Core ML 4-bit)0,7770,77166,7 MB
Qwen3Guard-Gen-0.6B (bf16)0,6520,770server
Llama-Guard-3-1B (bf16)0,6490,814server
Llama-Guard-3-1B (int4)0,6330,794955 MB
Qwen3Guard-Gen-0.6B (int4)0,6220,750484 MB
Detoxify multilingual (fp32)0,4870,642~280 MB

Intern utvärdering på HateCheck-sviten (ungefär 3 700 handskrivna testfall per språk), aldrig använd för träning. Konkurrenterna körs på samma testrigg.

Användningsfall

Sortering före sändning i meddelanden

Poängsätt utgående meddelanden på enheten innan de lämnar telefonen, så att hatfullt, hotfullt eller trakasserande innehåll kan utlösa en varning direkt i flödet eller en granskningsväg utan att någonsin nå dina servrar.

Kommentarsortering utan server

Kör varje inkommande kommentar genom Toxic lokalt i klienten, flagga troligt hatprat till en moderatorkö och eskalera endast flaggad text till en människa. Skär bort volymen som behöver central moderering utan ett molnanrop per meddelande.

Dirigera signaler om självskada och hot till hjälp

Huvudena för självskada och hot är åtskilda från det hatfulla huvudet, så en klient kan visa en krisresurs eller en eskaleringsväg utan att blanda ihop någon av signalerna med hat.

Åtta språk i en modell

En enda artefakt på 75 MB täcker engelska, spanska, portugisiska, franska, tyska, italienska, polska och nederländska. En integration för åtta språk, utan pipeline per språk och utan separat språkidentifiering.

Vad den gör

  • Fem innehållshuvuden med flera etiketter: hatfullt, trakasserier, hot, sexuellt, självskada.
  • Tio målhuvuden ovanpå det hatfulla huvudet: ras, hudfärg, religion, härkomst, nationellt eller etniskt ursprung, sexuell läggning, kön, funktionsnedsättning, ålder, annat.
  • Åtta språk från en enda artefakt: engelska, spanska, portugisiska, franska, tyska, italienska, polska, nederländska. En tröskelmeny per språk följer med i modellens metadata.
  • Tränad enbart på tillåtande licensierade korpusar (CC0, CC-BY, MIT, Apache-2.0), så den kan lanseras i en kommersiell produkt.
  • Körs helt på enheten: 66,7 MB Core ML (4-bitars, ANE-optimerad) eller 75,5 MB LiteRT (int4 blockwise-32).

Specifikationer

Språk
8: engelska, spanska, portugisiska, franska, tyska, italienska, polska, nederländska
Storlek på enheten
66,7 MB Core ML (4-bitars); 75,5 MB LiteRT (int4 blockwise-32)
Backbone
XLM-R-base med en beskuren vokabulär på 60 728 delar, 12 lager, dolt 768, ~133M parametrar
Träffsäkerhet
0,786 makro-F1 över 8 språk (LiteRT int4), 0,777 (Core ML 4-bitars)

Ett hjälpmedel för sortering i moderering, inte ett avgörande: eskalera flaggor till en mänsklig granskare eller en tyngre lokal nivå i stället för att ta bort automatiskt. Under motståndstester kan Toxic flagga motprat, negerat hat, återtagna skällsord och korta identitetsomnämnanden i en märkbar andel fall, särskilt på engelska och tyska. För nederländska, tyska och polska bör den kombineras med en språkspecifik ordlista med skällsord för att fånga bara skällsord som den missar.

Vanliga frågor

Vad är Toxic?

Flerspråkig klassificerare med flera etiketter på enheten som flaggar hatfullt, trakasserande, hotfullt, sexuellt och självskadande innehåll på engelska, spanska, portugisiska, franska, tyska, italienska, polska och nederländska, så att tveksam text kan sorteras innan den lämnar enheten.

Körs Toxic lokalt på enheten?

Ja. Toxic körs helt lokalt på enheten: inferensen sker lokalt utan något serveranrop, så data lämnar aldrig enheten.

Är Toxic tillgänglig än?

Toxic är i stängd beta. Du kan begära tidig åtkomst från dess sida.

Vad kostar Toxic?

Varje modell är gratis för upp till 100k månadsaktiva enheter per SDK. Obegränsad inferens per användare. Kontakta oss för anpassade licenser.

Hur träffsäker eller snabb är Toxic?

Slår Llama-Guard-3-1B och Qwen3Guard-Gen-0.6B med 13 till 17 makro-F1-poäng på de sju EU-språken, till en storlek som är 6 till 14 gånger mindre: 75,5 MB LiteRT mot 500 MB till 1 GB för guard-modellerna.

Tidig åtkomst

Berätta vad du bygger, så hjälper vi dig igång.