Toxic : détection multilingue de discours de haine sur l'appareil
Classifieur multi-étiquettes sur l'appareil qui signale les contenus haineux, harcelants, menaçants, sexuels et d'automutilation en anglais, espagnol, portugais, français, allemand, italien, polonais et néerlandais, pour que les textes douteux puissent être triés avant même de quitter l'appareil.
Toxic est un classifieur multi-étiquettes sur l'appareil pour le discours de haine, le harcèlement, les menaces, le harcèlement sexuel et l'automutilation, dans huit langues : anglais, espagnol, portugais, français, allemand, italien, polonais et néerlandais. Quand la tête de haine s'active, dix têtes cibles identifient le motif protégé visé par le texte : race, couleur, religion, ascendance, origine nationale ou ethnique, orientation sexuelle, genre, handicap, âge ou autre.
Son atout, c'est la taille rapportée à la qualité. Toxic devance Llama-Guard-3-1B et Qwen3Guard-Gen-0.6B de 13 à 17 points de F1 macro sur les sept langues européennes, et Detoxify de 30, pour une fraction de leur empreinte disque (75,5 MB LiteRT, 66,7 MB Core ML, contre environ 500 MB à 1 GB pour les builds guard). Les données d'entraînement sont commercialement propres (CC0, CC-BY, MIT, Apache-2.0 uniquement), pour que le modèle puisse être distribué dans un produit sans l'exposition juridique des corpus de discours de haine récupérés.
Performances
Devance Llama-Guard-3-1B et Qwen3Guard-Gen-0.6B de 13 à 17 points de F1 macro sur les sept langues européennes, pour 6 à 14 fois moins volumineux : 75,5 MB LiteRT contre 500 MB à 1 GB pour les builds guard.
F1 macro au seuil 0,40 dans le même harnais HateCheck (interne). La colonne 7-UE est la moyenne sur l'espagnol, le portugais, le français, l'allemand, l'italien, le polonais et le néerlandais. Toxic l'emporte nettement sur 7 langues sur 8 ; Llama-Guard ne devance qu'en anglais.
| Modèle | F1 7-UE | F1 EN | Taille |
|---|---|---|---|
| Toxic (LiteRT int4) | 0,786 | 0,787 | 75,5 MB |
| Toxic (Core ML 4-bit) | 0,777 | 0,771 | 66,7 MB |
| Qwen3Guard-Gen-0.6B (bf16) | 0,652 | 0,770 | server |
| Llama-Guard-3-1B (bf16) | 0,649 | 0,814 | server |
| Llama-Guard-3-1B (int4) | 0,633 | 0,794 | 955 MB |
| Qwen3Guard-Gen-0.6B (int4) | 0,622 | 0,750 | 484 MB |
| Detoxify multilingual (fp32) | 0,487 | 0,642 | ~280 MB |
Évaluation interne sur la suite HateCheck (environ 3 700 cas de test rédigés à la main par langue), jamais utilisée pour l'entraînement. Concurrents rejoués dans le même harnais.
Cas d'usage
Triage avant envoi en messagerie
Notez les messages sortants sur l'appareil avant qu'ils ne quittent le téléphone, pour que les contenus haineux, menaçants ou harcelants puissent déclencher un avertissement en ligne ou un parcours de revue sans jamais atteindre vos serveurs.
Triage des commentaires sans serveur
Faites passer chaque commentaire entrant par Toxic localement, dans le client, signalez les discours de haine probables vers une file de modération, et n'escaladez à un humain que le texte signalé. Réduit le volume à modérer côté central, sans un appel au cloud par message.
Orientez les signaux d'automutilation et de menace vers l'aide
Les têtes d'automutilation et de menace sont distinctes de la tête de haine, pour qu'un client puisse afficher une ressource de crise ou un parcours d'escalade sans confondre l'un ou l'autre signal avec de la haine.
Huit langues dans un seul modèle
Un seul artefact de 75 MB couvre l'anglais, l'espagnol, le portugais, le français, l'allemand, l'italien, le polonais et le néerlandais. Une intégration pour huit langues, sans pipeline par langue ni étape séparée de détection de la langue.
Ce que ça fait
- Cinq têtes de contenu multi-étiquettes : haine, harcèlement, menace, sexuel, automutilation.
- Dix têtes cibles au-dessus de la tête de haine : race, couleur, religion, ascendance, origine nationale ou ethnique, orientation sexuelle, genre, handicap, âge, autre.
- Huit langues depuis un seul artefact : anglais, espagnol, portugais, français, allemand, italien, polonais, néerlandais. Un menu de seuils par langue est livré dans les métadonnées du modèle.
- Entraîné uniquement sur des corpus sous licence permissive (CC0, CC-BY, MIT, Apache-2.0), pour pouvoir être distribué dans un produit commercial.
- Tourne entièrement sur l'appareil : 66,7 MB Core ML (4 bits, optimisé pour l'ANE) ou 75,5 MB LiteRT (int4 blockwise-32).
Spécifications
- Langues
- 8 : anglais, espagnol, portugais, français, allemand, italien, polonais, néerlandais
- Taille sur l'appareil
- 66,7 MB Core ML (4 bits) ; 75,5 MB LiteRT (int4 blockwise-32)
- Backbone
- XLM-R-base avec un vocabulaire réduit à 60 728 pièces, 12 couches, dim. cachée 768, ~133 M de paramètres
- Précision
- 0,786 F1 macro sur 8 langues (LiteRT int4), 0,777 (Core ML 4 bits)
Une aide au triage de modération, pas un verdict : remontez les signalements à un modérateur humain ou à un niveau local plus lourd plutôt que de supprimer automatiquement. En tests adverses, Toxic peut signaler à tort du contre-discours, de la haine niée, des insultes réappropriées et de courtes mentions d'identité dans une part significative des cas, notamment en anglais et en allemand. En néerlandais, allemand et polonais, associez-le à une liste d'insultes par langue pour rattraper les termes bruts qu'il manque.
FAQ
Qu'est-ce que Toxic ?
Classifieur multi-étiquettes sur l'appareil qui signale les contenus haineux, harcelants, menaçants, sexuels et d'automutilation en anglais, espagnol, portugais, français, allemand, italien, polonais et néerlandais, pour que les textes douteux puissent être triés avant même de quitter l'appareil.
Toxic fonctionne-t-il sur l'appareil ?
Oui. Toxic s'exécute entièrement sur l'appareil : l'inférence a lieu en local, sans appel serveur, de sorte que les données ne quittent jamais l'appareil.
Toxic est-il déjà disponible ?
Toxic est en bêta fermée. Vous pouvez demander un accès anticipé depuis sa page.
Combien coûte Toxic ?
Chaque modèle est gratuit jusqu'à 100k appareils actifs mensuels par SDK. Inférence illimitée par utilisateur. Contactez-nous pour des licences sur mesure.
Quelle est la précision ou la vitesse de Toxic ?
Devance Llama-Guard-3-1B et Qwen3Guard-Gen-0.6B de 13 à 17 points de F1 macro sur les sept langues européennes, pour 6 à 14 fois moins volumineux : 75,5 MB LiteRT contre 500 MB à 1 GB pour les builds guard.
Accès anticipé
Dites-nous ce que vous construisez et nous vous aidons à démarrer.