Desert Ant Labs

Toxic: rilevamento multilingue dell'hate speech on-device

Moderazione dei contenutiBeta chiusa

Classificatore multi-etichetta on-device che segnala contenuti d'odio, molestie, minacce, sessuali e di autolesionismo in inglese, spagnolo, portoghese, francese, tedesco, italiano, polacco e olandese, così un testo dubbio può essere gestito in triage prima ancora di lasciare il dispositivo.

Toxic è un classificatore multi-etichetta on-device per hate speech, molestie, minacce, molestie sessuali e autolesionismo in otto lingue: inglese, spagnolo, portoghese, francese, tedesco, italiano, polacco e olandese. Quando la testa hateful si attiva, dieci teste di target identificano quale categoria protetta è presa di mira dal testo: razza, colore, religione, discendenza, origine nazionale o etnica, orientamento sessuale, genere, disabilità, età o altro.

Il punto di forza è la dimensione contro la qualità. Toxic batte Llama-Guard-3-1B e Qwen3Guard-Gen-0.6B da 13 a 17 punti di macro F1 sulle sette lingue UE, e Detoxify di 30, con una frazione della loro dimensione su disco (75,5 MB LiteRT, 66,7 MB Core ML, contro circa 500 MB - 1 GB per le build dei guard model). I dati di addestramento sono puliti sotto il profilo commerciale (solo CC0, CC-BY, MIT, Apache-2.0), quindi si può distribuirlo in un prodotto senza l'esposizione di licenza dei corpora di hate speech raccolti dal web.

Toxic è in beta chiusa. La model card e i pesi sono pubblici. Accesso anticipato su richiesta.

Prestazioni

Batte Llama-Guard-3-1B e Qwen3Guard-Gen-0.6B da 13 a 17 punti di macro F1 sulle sette lingue UE, con dimensioni da 6 a 14 volte inferiori: 75,5 MB LiteRT contro 500 MB - 1 GB per le build dei guard model.

0,786
Macro F1
0,881
Recall sull'odio
66,7 MB
On-device
2,82 ms
Per passata

Macro F1 a soglia 0,40 con lo stesso harness HateCheck (interno). La colonna «7 UE» è la media su spagnolo, portoghese, francese, tedesco, italiano, polacco e olandese. Toxic vince in modo netto su 7 lingue su 8; Llama-Guard è in testa solo sull'inglese.

ModelloF1 7 UEF1 ENDimensione
Toxic (LiteRT int4)0,7860,78775,5 MB
Toxic (Core ML 4-bit)0,7770,77166,7 MB
Qwen3Guard-Gen-0.6B (bf16)0,6520,770server
Llama-Guard-3-1B (bf16)0,6490,814server
Llama-Guard-3-1B (int4)0,6330,794955 MB
Qwen3Guard-Gen-0.6B (int4)0,6220,750484 MB
Detoxify multilingual (fp32)0,4870,642~280 MB

Valutazione interna sulla suite HateCheck (circa 3.700 casi di test scritti a mano per lingua), mai usata per l'addestramento. I concorrenti vengono rivalutati con lo stesso harness.

Casi d'uso

Triage prima dell'invio nei messaggi

Valuta i messaggi in uscita sul dispositivo prima che lascino il telefono, così contenuti d'odio, minacce o molestie possono attivare un avviso in linea o un percorso di revisione senza mai raggiungere i tuoi server.

Triage dei commenti senza server

Passa ogni commento in arrivo per Toxic in locale nel client, segnala i probabili hate speech a una coda di moderazione e inoltra a un umano solo il testo segnalato. Riduce il volume che richiede moderazione centrale senza una chiamata in cloud per messaggio.

Indirizza i segnali di autolesionismo e minaccia verso l'aiuto

Le teste di autolesionismo e minaccia sono separate da quella hateful, così un client può proporre una risorsa per situazioni di crisi o un percorso di escalation senza confondere nessuno dei due segnali con l'odio.

Otto lingue in un unico modello

Un singolo artefatto da 75 MB copre inglese, spagnolo, portoghese, francese, tedesco, italiano, polacco e olandese. Un'unica integrazione per otto lingue, senza pipeline per lingua e senza una fase separata di rilevamento della lingua.

Cosa fa

  • Cinque teste multi-etichetta di contenuto: hateful, molestie, minacce, sessuali, autolesionismo.
  • Dieci teste di target sopra la testa hateful: razza, colore, religione, discendenza, origine nazionale o etnica, orientamento sessuale, genere, disabilità, età, altro.
  • Otto lingue da un unico artefatto: inglese, spagnolo, portoghese, francese, tedesco, italiano, polacco, olandese. Nei metadati del modello è incluso un menu di soglie per lingua.
  • Addestrato solo su corpora con licenza permissiva (CC0, CC-BY, MIT, Apache-2.0), quindi si può distribuire in un prodotto commerciale.
  • Gira interamente sul dispositivo: 66,7 MB Core ML (4 bit, ottimizzato per Apple Neural Engine) o 75,5 MB LiteRT (int4 blockwise-32).

Specifiche

Lingue
8: inglese, spagnolo, portoghese, francese, tedesco, italiano, polacco, olandese
Dimensione on-device
66,7 MB Core ML (4 bit); 75,5 MB LiteRT (int4 blockwise-32)
Backbone
XLM-R-base con vocabolario ridotto a 60.728 pezzi, 12 layer, hidden 768, ~133M di parametri
Precisione
0,786 macro F1 sulle 8 lingue (LiteRT int4), 0,777 (Core ML 4 bit)

Un ausilio al triage della moderazione, non un verdetto: inoltra le segnalazioni a un revisore umano o a un livello locale più pesante invece di rimuovere in automatico. Sotto test avversariali, Toxic può segnalare controdiscorso, odio negato, insulti rivendicati e brevi menzioni di identità in una quota significativa di casi, soprattutto in inglese e tedesco. Per olandese, tedesco e polacco, affiancalo a una lista di insulti per lingua per catturare gli insulti isolati che Toxic non coglie.

FAQ

Cos'è Toxic?

Classificatore multi-etichetta on-device che segnala contenuti d'odio, molestie, minacce, sessuali e di autolesionismo in inglese, spagnolo, portoghese, francese, tedesco, italiano, polacco e olandese, così un testo dubbio può essere gestito in triage prima ancora di lasciare il dispositivo.

Toxic funziona sul dispositivo?

Sì. Toxic funziona interamente sul dispositivo: l'inferenza avviene in locale senza alcuna chiamata a un server, quindi i dati non lasciano mai il dispositivo.

Toxic è già disponibile?

Toxic è in beta chiusa. Puoi richiedere l'accesso anticipato dalla sua pagina.

Quanto costa Toxic?

Ogni modello è gratuito fino a 100k dispositivi attivi mensili per SDK. Inferenza illimitata per utente. Contattaci per licenze personalizzate.

Quanto è preciso o veloce Toxic?

Batte Llama-Guard-3-1B e Qwen3Guard-Gen-0.6B da 13 a 17 punti di macro F1 sulle sette lingue UE, con dimensioni da 6 a 14 volte inferiori: 75,5 MB LiteRT contro 500 MB - 1 GB per le build dei guard model.

Accesso anticipato

Raccontaci cosa stai costruendo e ti aiutiamo a iniziare.