Desert Ant Labs

Toxic: detección multilingüe de discurso de odio en el dispositivo

Moderación de contenidoBeta cerrada

Clasificador multietiqueta en el dispositivo que marca contenido de odio, acoso, amenazas, sexual y de autolesión en inglés, español, portugués, francés, alemán, italiano, polaco y neerlandés, para que el texto dudoso pueda clasificarse antes de que salga del dispositivo.

Toxic es un clasificador multietiqueta en el dispositivo para discurso de odio, acoso, amenazas, acoso sexual y autolesión en ocho idiomas: inglés, español, portugués, francés, alemán, italiano, polaco y neerlandés. Cuando se activa la cabeza de odio, diez cabezas de objetivo identifican a qué grupo protegido apunta el texto: raza, color, religión, ascendencia, origen nacional o étnico, orientación sexual, género, discapacidad, edad u otro.

La ventaja es tamaño frente a calidad. Toxic supera a Llama-Guard-3-1B y Qwen3Guard-Gen-0.6B por 13 a 17 puntos de macro F1 en los siete idiomas de la UE, y a Detoxify por 30, con una fracción de su ocupación en disco (75,5 MB LiteRT, 66,7 MB Core ML, frente a aproximadamente 500 MB a 1 GB de los modelos guard). Los datos de entrenamiento son limpios para uso comercial (solo CC0, CC-BY, MIT y Apache-2.0), así que puede incluirse en un producto sin la exposición de licencias de los corpus de discurso de odio extraídos de la web.

Toxic está en beta cerrada. La ficha del modelo y los pesos son públicos. Acceso anticipado bajo petición.

Rendimiento

Supera a Llama-Guard-3-1B y Qwen3Guard-Gen-0.6B por 13 a 17 puntos de macro F1 en los siete idiomas de la UE, siendo de 6 a 14 veces más pequeño: 75,5 MB LiteRT frente a 500 MB a 1 GB de los modelos guard.

0,786
Macro F1
0,881
Recall de odio
66,7 MB
En el dispositivo
2,82 ms
Por pasada

Macro F1 con umbral 0,40 sobre el mismo arnés HateCheck (interno). La columna 7-UE es el promedio de español, portugués, francés, alemán, italiano, polaco y neerlandés. Toxic gana con claridad en 7 de 8 idiomas; Llama-Guard solo lidera en inglés.

ModeloF1 7-UEF1 ENTamaño
Toxic (LiteRT int4)0,7860,78775,5 MB
Toxic (Core ML 4-bit)0,7770,77166,7 MB
Qwen3Guard-Gen-0.6B (bf16)0,6520,770server
Llama-Guard-3-1B (bf16)0,6490,814server
Llama-Guard-3-1B (int4)0,6330,794955 MB
Qwen3Guard-Gen-0.6B (int4)0,6220,750484 MB
Detoxify multilingual (fp32)0,4870,642~280 MB

Evaluación interna sobre el conjunto HateCheck (aproximadamente 3700 casos de prueba escritos a mano por idioma), nunca usado para entrenar. Los competidores se vuelven a ejecutar en el mismo arnés.

Casos de uso

Clasificación previa al envío en mensajería

Puntúa los mensajes salientes en el dispositivo antes de que salgan del teléfono, para que el contenido de odio, amenazante o de acoso pueda activar un aviso en línea o una ruta de revisión sin llegar nunca a tus servidores.

Clasificación de comentarios sin servidor

Pasa cada comentario entrante por Toxic de forma local en el cliente, marca los probables casos de discurso de odio para una cola de moderación y escala solo el texto marcado a un humano. Reduce el volumen que necesita moderación central sin una llamada a la nube por mensaje.

Deriva las señales de autolesión y amenaza a ayuda

Las cabezas de autolesión y de amenaza están separadas de la de odio, así que un cliente puede mostrar un recurso de crisis o una ruta de escalada sin confundir ninguna de las dos señales con odio.

Ocho idiomas en un solo modelo

Un único artefacto de 75 MB cubre inglés, español, portugués, francés, alemán, italiano, polaco y neerlandés. Una sola integración para ocho idiomas, sin pipeline por idioma y sin un paso aparte de detección de idioma.

Qué hace

  • Cinco cabezas de contenido multietiqueta: odio, acoso, amenaza, sexual, autolesión.
  • Diez cabezas de objetivo encima de la cabeza de odio: raza, color, religión, ascendencia, origen nacional o étnico, orientación sexual, género, discapacidad, edad, otro.
  • Ocho idiomas desde un único artefacto: inglés, español, portugués, francés, alemán, italiano, polaco, neerlandés. Un menú de umbrales por idioma se incluye en los metadatos del modelo.
  • Entrenado únicamente con corpus de licencia permisiva (CC0, CC-BY, MIT, Apache-2.0), así que puede incluirse en un producto comercial.
  • Se ejecuta por completo en el dispositivo: 66,7 MB Core ML (4 bits, optimizado para Apple Neural Engine) o 75,5 MB LiteRT (int4 blockwise-32).

Especificaciones

Idiomas
8: inglés, español, portugués, francés, alemán, italiano, polaco, neerlandés
Tamaño en el dispositivo
66,7 MB Core ML (4 bits); 75,5 MB LiteRT (int4 blockwise-32)
Backbone
XLM-R-base con vocabulario recortado a 60 728 piezas, 12 capas, oculto 768, ~133 M de parámetros
Precisión
0,786 macro F1 en 8 idiomas (LiteRT int4), 0,777 (Core ML 4 bits)

Una ayuda para clasificar en moderación, no un veredicto: escala las marcas a un revisor humano o a un nivel local más pesado en lugar de eliminarlas de forma automática. En pruebas adversariales, Toxic puede marcar contra-discurso, odio negado, insultos reapropiados y menciones breves de identidad en una proporción significativa de los casos, sobre todo en inglés y alemán. Para neerlandés, alemán y polaco, combínalo con una lista de insultos por idioma para captar los insultos aislados que se le escapan.

Preguntas frecuentes

¿Qué es Toxic?

Clasificador multietiqueta en el dispositivo que marca contenido de odio, acoso, amenazas, sexual y de autolesión en inglés, español, portugués, francés, alemán, italiano, polaco y neerlandés, para que el texto dudoso pueda clasificarse antes de que salga del dispositivo.

¿Toxic se ejecuta en el dispositivo?

Sí. Toxic se ejecuta por completo en el dispositivo: la inferencia ocurre localmente sin ninguna llamada a servidor, así que los datos nunca salen del dispositivo.

¿Ya está disponible Toxic?

Toxic está en beta cerrada. Puedes solicitar acceso anticipado desde su página.

¿Cuánto cuesta Toxic?

Todos los modelos son gratis hasta 100 000 dispositivos activos mensuales por SDK. Inferencia ilimitada por usuario. Contáctanos para licencias personalizadas.

¿Qué precisión o velocidad tiene Toxic?

Supera a Llama-Guard-3-1B y Qwen3Guard-Gen-0.6B por 13 a 17 puntos de macro F1 en los siete idiomas de la UE, siendo de 6 a 14 veces más pequeño: 75,5 MB LiteRT frente a 500 MB a 1 GB de los modelos guard.

Acceso anticipado

Cuéntanos qué estás construyendo y te lo dejamos listo.