Toxic: detección multilingüe de discurso de odio en el dispositivo
Clasificador multietiqueta en el dispositivo que marca contenido de odio, acoso, amenazas, sexual y de autolesión en inglés, español, portugués, francés, alemán, italiano, polaco y neerlandés, para que el texto dudoso pueda clasificarse antes de que salga del dispositivo.
Toxic es un clasificador multietiqueta en el dispositivo para discurso de odio, acoso, amenazas, acoso sexual y autolesión en ocho idiomas: inglés, español, portugués, francés, alemán, italiano, polaco y neerlandés. Cuando se activa la cabeza de odio, diez cabezas de objetivo identifican a qué grupo protegido apunta el texto: raza, color, religión, ascendencia, origen nacional o étnico, orientación sexual, género, discapacidad, edad u otro.
La ventaja es tamaño frente a calidad. Toxic supera a Llama-Guard-3-1B y Qwen3Guard-Gen-0.6B por 13 a 17 puntos de macro F1 en los siete idiomas de la UE, y a Detoxify por 30, con una fracción de su ocupación en disco (75,5 MB LiteRT, 66,7 MB Core ML, frente a aproximadamente 500 MB a 1 GB de los modelos guard). Los datos de entrenamiento son limpios para uso comercial (solo CC0, CC-BY, MIT y Apache-2.0), así que puede incluirse en un producto sin la exposición de licencias de los corpus de discurso de odio extraídos de la web.
Rendimiento
Supera a Llama-Guard-3-1B y Qwen3Guard-Gen-0.6B por 13 a 17 puntos de macro F1 en los siete idiomas de la UE, siendo de 6 a 14 veces más pequeño: 75,5 MB LiteRT frente a 500 MB a 1 GB de los modelos guard.
Macro F1 con umbral 0,40 sobre el mismo arnés HateCheck (interno). La columna 7-UE es el promedio de español, portugués, francés, alemán, italiano, polaco y neerlandés. Toxic gana con claridad en 7 de 8 idiomas; Llama-Guard solo lidera en inglés.
| Modelo | F1 7-UE | F1 EN | Tamaño |
|---|---|---|---|
| Toxic (LiteRT int4) | 0,786 | 0,787 | 75,5 MB |
| Toxic (Core ML 4-bit) | 0,777 | 0,771 | 66,7 MB |
| Qwen3Guard-Gen-0.6B (bf16) | 0,652 | 0,770 | server |
| Llama-Guard-3-1B (bf16) | 0,649 | 0,814 | server |
| Llama-Guard-3-1B (int4) | 0,633 | 0,794 | 955 MB |
| Qwen3Guard-Gen-0.6B (int4) | 0,622 | 0,750 | 484 MB |
| Detoxify multilingual (fp32) | 0,487 | 0,642 | ~280 MB |
Evaluación interna sobre el conjunto HateCheck (aproximadamente 3700 casos de prueba escritos a mano por idioma), nunca usado para entrenar. Los competidores se vuelven a ejecutar en el mismo arnés.
Casos de uso
Clasificación previa al envío en mensajería
Puntúa los mensajes salientes en el dispositivo antes de que salgan del teléfono, para que el contenido de odio, amenazante o de acoso pueda activar un aviso en línea o una ruta de revisión sin llegar nunca a tus servidores.
Clasificación de comentarios sin servidor
Pasa cada comentario entrante por Toxic de forma local en el cliente, marca los probables casos de discurso de odio para una cola de moderación y escala solo el texto marcado a un humano. Reduce el volumen que necesita moderación central sin una llamada a la nube por mensaje.
Deriva las señales de autolesión y amenaza a ayuda
Las cabezas de autolesión y de amenaza están separadas de la de odio, así que un cliente puede mostrar un recurso de crisis o una ruta de escalada sin confundir ninguna de las dos señales con odio.
Ocho idiomas en un solo modelo
Un único artefacto de 75 MB cubre inglés, español, portugués, francés, alemán, italiano, polaco y neerlandés. Una sola integración para ocho idiomas, sin pipeline por idioma y sin un paso aparte de detección de idioma.
Qué hace
- Cinco cabezas de contenido multietiqueta: odio, acoso, amenaza, sexual, autolesión.
- Diez cabezas de objetivo encima de la cabeza de odio: raza, color, religión, ascendencia, origen nacional o étnico, orientación sexual, género, discapacidad, edad, otro.
- Ocho idiomas desde un único artefacto: inglés, español, portugués, francés, alemán, italiano, polaco, neerlandés. Un menú de umbrales por idioma se incluye en los metadatos del modelo.
- Entrenado únicamente con corpus de licencia permisiva (CC0, CC-BY, MIT, Apache-2.0), así que puede incluirse en un producto comercial.
- Se ejecuta por completo en el dispositivo: 66,7 MB Core ML (4 bits, optimizado para Apple Neural Engine) o 75,5 MB LiteRT (int4 blockwise-32).
Especificaciones
- Idiomas
- 8: inglés, español, portugués, francés, alemán, italiano, polaco, neerlandés
- Tamaño en el dispositivo
- 66,7 MB Core ML (4 bits); 75,5 MB LiteRT (int4 blockwise-32)
- Backbone
- XLM-R-base con vocabulario recortado a 60 728 piezas, 12 capas, oculto 768, ~133 M de parámetros
- Precisión
- 0,786 macro F1 en 8 idiomas (LiteRT int4), 0,777 (Core ML 4 bits)
Una ayuda para clasificar en moderación, no un veredicto: escala las marcas a un revisor humano o a un nivel local más pesado en lugar de eliminarlas de forma automática. En pruebas adversariales, Toxic puede marcar contra-discurso, odio negado, insultos reapropiados y menciones breves de identidad en una proporción significativa de los casos, sobre todo en inglés y alemán. Para neerlandés, alemán y polaco, combínalo con una lista de insultos por idioma para captar los insultos aislados que se le escapan.
Preguntas frecuentes
¿Qué es Toxic?
Clasificador multietiqueta en el dispositivo que marca contenido de odio, acoso, amenazas, sexual y de autolesión en inglés, español, portugués, francés, alemán, italiano, polaco y neerlandés, para que el texto dudoso pueda clasificarse antes de que salga del dispositivo.
¿Toxic se ejecuta en el dispositivo?
Sí. Toxic se ejecuta por completo en el dispositivo: la inferencia ocurre localmente sin ninguna llamada a servidor, así que los datos nunca salen del dispositivo.
¿Ya está disponible Toxic?
Toxic está en beta cerrada. Puedes solicitar acceso anticipado desde su página.
¿Cuánto cuesta Toxic?
Todos los modelos son gratis hasta 100 000 dispositivos activos mensuales por SDK. Inferencia ilimitada por usuario. Contáctanos para licencias personalizadas.
¿Qué precisión o velocidad tiene Toxic?
Supera a Llama-Guard-3-1B y Qwen3Guard-Gen-0.6B por 13 a 17 puntos de macro F1 en los siete idiomas de la UE, siendo de 6 a 14 veces más pequeño: 75,5 MB LiteRT frente a 500 MB a 1 GB de los modelos guard.
Acceso anticipado
Cuéntanos qué estás construyendo y te lo dejamos listo.