Toxic: rilevamento multilingue dell'hate speech on-device
Classificatore multi-etichetta on-device che segnala contenuti d'odio, molestie, minacce, sessuali e di autolesionismo in inglese, spagnolo, portoghese, francese, tedesco, italiano, polacco e olandese, così un testo dubbio può essere gestito in triage prima ancora di lasciare il dispositivo.
Toxic è un classificatore multi-etichetta on-device per hate speech, molestie, minacce, molestie sessuali e autolesionismo in otto lingue: inglese, spagnolo, portoghese, francese, tedesco, italiano, polacco e olandese. Quando la testa hateful si attiva, dieci teste di target identificano quale categoria protetta è presa di mira dal testo: razza, colore, religione, discendenza, origine nazionale o etnica, orientamento sessuale, genere, disabilità, età o altro.
Il punto di forza è la dimensione contro la qualità. Toxic batte Llama-Guard-3-1B e Qwen3Guard-Gen-0.6B da 13 a 17 punti di macro F1 sulle sette lingue UE, e Detoxify di 30, con una frazione della loro dimensione su disco (75,5 MB LiteRT, 66,7 MB Core ML, contro circa 500 MB - 1 GB per le build dei guard model). I dati di addestramento sono puliti sotto il profilo commerciale (solo CC0, CC-BY, MIT, Apache-2.0), quindi si può distribuirlo in un prodotto senza l'esposizione di licenza dei corpora di hate speech raccolti dal web.
Prestazioni
Batte Llama-Guard-3-1B e Qwen3Guard-Gen-0.6B da 13 a 17 punti di macro F1 sulle sette lingue UE, con dimensioni da 6 a 14 volte inferiori: 75,5 MB LiteRT contro 500 MB - 1 GB per le build dei guard model.
Macro F1 a soglia 0,40 con lo stesso harness HateCheck (interno). La colonna «7 UE» è la media su spagnolo, portoghese, francese, tedesco, italiano, polacco e olandese. Toxic vince in modo netto su 7 lingue su 8; Llama-Guard è in testa solo sull'inglese.
| Modello | F1 7 UE | F1 EN | Dimensione |
|---|---|---|---|
| Toxic (LiteRT int4) | 0,786 | 0,787 | 75,5 MB |
| Toxic (Core ML 4-bit) | 0,777 | 0,771 | 66,7 MB |
| Qwen3Guard-Gen-0.6B (bf16) | 0,652 | 0,770 | server |
| Llama-Guard-3-1B (bf16) | 0,649 | 0,814 | server |
| Llama-Guard-3-1B (int4) | 0,633 | 0,794 | 955 MB |
| Qwen3Guard-Gen-0.6B (int4) | 0,622 | 0,750 | 484 MB |
| Detoxify multilingual (fp32) | 0,487 | 0,642 | ~280 MB |
Valutazione interna sulla suite HateCheck (circa 3.700 casi di test scritti a mano per lingua), mai usata per l'addestramento. I concorrenti vengono rivalutati con lo stesso harness.
Casi d'uso
Triage prima dell'invio nei messaggi
Valuta i messaggi in uscita sul dispositivo prima che lascino il telefono, così contenuti d'odio, minacce o molestie possono attivare un avviso in linea o un percorso di revisione senza mai raggiungere i tuoi server.
Triage dei commenti senza server
Passa ogni commento in arrivo per Toxic in locale nel client, segnala i probabili hate speech a una coda di moderazione e inoltra a un umano solo il testo segnalato. Riduce il volume che richiede moderazione centrale senza una chiamata in cloud per messaggio.
Indirizza i segnali di autolesionismo e minaccia verso l'aiuto
Le teste di autolesionismo e minaccia sono separate da quella hateful, così un client può proporre una risorsa per situazioni di crisi o un percorso di escalation senza confondere nessuno dei due segnali con l'odio.
Otto lingue in un unico modello
Un singolo artefatto da 75 MB copre inglese, spagnolo, portoghese, francese, tedesco, italiano, polacco e olandese. Un'unica integrazione per otto lingue, senza pipeline per lingua e senza una fase separata di rilevamento della lingua.
Cosa fa
- Cinque teste multi-etichetta di contenuto: hateful, molestie, minacce, sessuali, autolesionismo.
- Dieci teste di target sopra la testa hateful: razza, colore, religione, discendenza, origine nazionale o etnica, orientamento sessuale, genere, disabilità, età, altro.
- Otto lingue da un unico artefatto: inglese, spagnolo, portoghese, francese, tedesco, italiano, polacco, olandese. Nei metadati del modello è incluso un menu di soglie per lingua.
- Addestrato solo su corpora con licenza permissiva (CC0, CC-BY, MIT, Apache-2.0), quindi si può distribuire in un prodotto commerciale.
- Gira interamente sul dispositivo: 66,7 MB Core ML (4 bit, ottimizzato per Apple Neural Engine) o 75,5 MB LiteRT (int4 blockwise-32).
Specifiche
- Lingue
- 8: inglese, spagnolo, portoghese, francese, tedesco, italiano, polacco, olandese
- Dimensione on-device
- 66,7 MB Core ML (4 bit); 75,5 MB LiteRT (int4 blockwise-32)
- Backbone
- XLM-R-base con vocabolario ridotto a 60.728 pezzi, 12 layer, hidden 768, ~133M di parametri
- Precisione
- 0,786 macro F1 sulle 8 lingue (LiteRT int4), 0,777 (Core ML 4 bit)
Un ausilio al triage della moderazione, non un verdetto: inoltra le segnalazioni a un revisore umano o a un livello locale più pesante invece di rimuovere in automatico. Sotto test avversariali, Toxic può segnalare controdiscorso, odio negato, insulti rivendicati e brevi menzioni di identità in una quota significativa di casi, soprattutto in inglese e tedesco. Per olandese, tedesco e polacco, affiancalo a una lista di insulti per lingua per catturare gli insulti isolati che Toxic non coglie.
FAQ
Cos'è Toxic?
Classificatore multi-etichetta on-device che segnala contenuti d'odio, molestie, minacce, sessuali e di autolesionismo in inglese, spagnolo, portoghese, francese, tedesco, italiano, polacco e olandese, così un testo dubbio può essere gestito in triage prima ancora di lasciare il dispositivo.
Toxic funziona sul dispositivo?
Sì. Toxic funziona interamente sul dispositivo: l'inferenza avviene in locale senza alcuna chiamata a un server, quindi i dati non lasciano mai il dispositivo.
Toxic è già disponibile?
Toxic è in beta chiusa. Puoi richiedere l'accesso anticipato dalla sua pagina.
Quanto costa Toxic?
Ogni modello è gratuito fino a 100k dispositivi attivi mensili per SDK. Inferenza illimitata per utente. Contattaci per licenze personalizzate.
Quanto è preciso o veloce Toxic?
Batte Llama-Guard-3-1B e Qwen3Guard-Gen-0.6B da 13 a 17 punti di macro F1 sulle sette lingue UE, con dimensioni da 6 a 14 volte inferiori: 75,5 MB LiteRT contro 500 MB - 1 GB per le build dei guard model.
Accesso anticipato
Raccontaci cosa stai costruendo e ti aiutiamo a iniziare.