Desert Ant Labs

Toxic: Mehrsprachige Hassrede-Erkennung auf dem Gerät

InhaltsmoderationGeschlossene Beta

Multi-Label-Klassifikator auf dem Gerät, der hasserfüllte, belästigende, bedrohliche, sexuelle und selbstverletzende Inhalte in Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Polnisch und Niederländisch markiert, sodass fragwürdiger Text vorsortiert werden kann, bevor er das Gerät verlässt.

Toxic ist ein Multi-Label-Klassifikator auf dem Gerät für Hassrede, Belästigung, Bedrohungen, sexuelle Belästigung und Selbstverletzung in acht Sprachen: Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Polnisch und Niederländisch. Wenn der Hass-Kopf auslöst, benennen zehn Ziel-Köpfe, welches geschützte Merkmal der Text angreift: Rasse, Hautfarbe, Religion, Abstammung, nationale oder ethnische Herkunft, sexuelle Orientierung, Geschlecht, Behinderung, Alter oder sonstige.

Der Vorteil ist Größe gegen Qualität. Toxic schlägt Llama-Guard-3-1B und Qwen3Guard-Gen-0.6B um 13 bis 17 Punkte Makro-F1 in den sieben EU-Sprachen und Detoxify um 30, bei einem Bruchteil ihres Speicherbedarfs (75,5 MB LiteRT, 66,7 MB Core ML gegenüber rund 500 MB bis 1 GB für die Guard-Modell-Builds). Die Trainingsdaten sind kommerziell sauber (nur CC0, CC-BY, MIT, Apache-2.0), sodass es in einem Produkt ausgeliefert werden kann, ohne das Lizenzrisiko gescrapter Hassrede-Korpora.

Toxic befindet sich in einer geschlossenen Beta. Die Modellkarte und die Gewichte sind öffentlich. Früher Zugang auf Anfrage.

Leistung

Schlägt Llama-Guard-3-1B und Qwen3Guard-Gen-0.6B um 13 bis 17 Punkte Makro-F1 in den sieben EU-Sprachen, bei 6- bis 14-mal geringerer Größe: 75,5 MB LiteRT gegenüber 500 MB bis 1 GB für die Guard-Modell-Builds.

0,786
Makro-F1
0,881
Hass-Recall
66,7 MB
Auf dem Gerät
2,82 ms
Pro Forward

Makro-F1 bei Schwellenwert 0,40 durch denselben HateCheck-Prüfstand (intern). Die Spalte 7-EU ist der Durchschnitt über Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Polnisch und Niederländisch. Toxic gewinnt in 7 von 8 Sprachen klar; Llama-Guard führt nur bei Englisch.

ModellF1 7-EUF1 ENGröße
Toxic (LiteRT int4)0,7860,78775,5 MB
Toxic (Core ML 4-bit)0,7770,77166,7 MB
Qwen3Guard-Gen-0.6B (bf16)0,6520,770server
Llama-Guard-3-1B (bf16)0,6490,814server
Llama-Guard-3-1B (int4)0,6330,794955 MB
Qwen3Guard-Gen-0.6B (int4)0,6220,750484 MB
Detoxify multilingual (fp32)0,4870,642~280 MB

Interne Evaluierung auf der HateCheck-Suite (rund 3.700 handgeschriebene Testfälle pro Sprache), niemals für das Training genutzt. Konkurrenten wurden durch denselben Prüfstand erneut ausgeführt.

Anwendungsfälle

Triage vor dem Senden in Messaging

Bewerten Sie ausgehende Nachrichten auf dem Gerät, bevor sie das Telefon verlassen, sodass hasserfüllte, bedrohliche oder belästigende Inhalte eine Inline-Warnung oder einen Prüfpfad auslösen können, ohne jemals Ihre Server zu erreichen.

Kommentar-Triage ohne Server

Lassen Sie jeden eingehenden Kommentar lokal im Client durch Toxic laufen, markieren Sie wahrscheinliche Hassrede für eine Moderator-Warteschlange und eskalieren Sie nur markierte Texte an einen Menschen. Das senkt das Volumen, das zentral moderiert werden muss, ohne einen Cloud-Aufruf pro Nachricht.

Signale zu Selbstverletzung und Bedrohung an Hilfe weiterleiten

Die Köpfe für Selbstverletzung und Bedrohung sind vom Hass-Kopf getrennt, sodass ein Client eine Krisenressource oder einen Eskalationspfad einblenden kann, ohne eines der Signale mit Hass zu vermengen.

Acht Sprachen in einem Modell

Ein einziges 75 MB großes Artefakt deckt Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Polnisch und Niederländisch ab. Eine Integration für acht Sprachen, ohne Pipeline pro Sprache und ohne separaten Schritt zur Spracherkennung.

Was es macht

  • Fünf Multi-Label-Inhaltsköpfe: hasserfüllt, Belästigung, Bedrohung, sexuell, Selbstverletzung.
  • Zehn Ziel-Köpfe zusätzlich zum Hass-Kopf: Rasse, Hautfarbe, Religion, Abstammung, nationale oder ethnische Herkunft, sexuelle Orientierung, Geschlecht, Behinderung, Alter, sonstige.
  • Acht Sprachen aus einem einzigen Artefakt: Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Polnisch, Niederländisch. Ein Schwellenwert-Menü pro Sprache liegt den Modell-Metadaten bei.
  • Trainiert ausschließlich mit freizügig lizenzierten Korpora (CC0, CC-BY, MIT, Apache-2.0), sodass es in einem kommerziellen Produkt ausgeliefert werden kann.
  • Läuft vollständig auf dem Gerät: 66,7 MB Core ML (4-Bit, ANE-optimiert) oder 75,5 MB LiteRT (int4 blockwise-32).

Technische Daten

Sprachen
8: Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Polnisch, Niederländisch
Größe auf dem Gerät
66,7 MB Core ML (4-Bit); 75,5 MB LiteRT (int4 blockwise-32)
Backbone
XLM-R-base mit gestutztem Vokabular aus 60.728 Tokens, 12 Schichten, Hidden 768, ~133M Parameter
Genauigkeit
0,786 Makro-F1 über 8 Sprachen (LiteRT int4), 0,777 (Core ML 4-Bit)

Eine Hilfe zur Moderationstriage, kein Urteil: Leiten Sie Markierungen an eine menschliche Prüfung oder eine schwerere lokale Stufe weiter, statt automatisch zu entfernen. Unter adversarialen Tests kann Toxic in einem nennenswerten Anteil der Fälle Gegenrede, negierten Hass, zurückeroberte Schmähbegriffe und kurze Identitätserwähnungen markieren, besonders in Englisch und Deutsch. Für Niederländisch, Deutsch und Polnisch kombinieren Sie es mit einer sprachspezifischen Schmähwortliste, um blanke Schmähbegriffe abzufangen, die es übersieht.

FAQ

Was ist Toxic?

Multi-Label-Klassifikator auf dem Gerät, der hasserfüllte, belästigende, bedrohliche, sexuelle und selbstverletzende Inhalte in Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Polnisch und Niederländisch markiert, sodass fragwürdiger Text vorsortiert werden kann, bevor er das Gerät verlässt.

Läuft Toxic auf dem Gerät?

Ja. Toxic läuft vollständig auf dem Gerät: Die Inferenz erfolgt lokal ohne Serveraufruf, sodass keine Daten das Gerät verlassen.

Ist Toxic schon verfügbar?

Toxic befindet sich in einer geschlossenen Beta. Sie können auf der zugehörigen Seite frühen Zugang anfordern.

Was kostet Toxic?

Jedes Modell ist für bis zu 100k monatlich aktive Geräte pro SDK kostenlos. Unbegrenzte Inferenz pro Nutzer. Kontaktieren Sie uns für individuelle Lizenzen.

Wie genau oder schnell ist Toxic?

Schlägt Llama-Guard-3-1B und Qwen3Guard-Gen-0.6B um 13 bis 17 Punkte Makro-F1 in den sieben EU-Sprachen, bei 6- bis 14-mal geringerer Größe: 75,5 MB LiteRT gegenüber 500 MB bis 1 GB für die Guard-Modell-Builds.

Früher Zugang

Sagen Sie uns, was Sie entwickeln, und wir richten Ihnen alles ein.