Toxic: detecção multilíngue de discurso de ódio no dispositivo
Classificador multirrótulo no dispositivo que sinaliza conteúdo de ódio, assédio, ameaça, sexual e de autolesão em inglês, espanhol, português, francês, alemão, italiano, polonês e holandês, para que textos suspeitos possam ser triados antes de sair do dispositivo.
O Toxic é um classificador multirrótulo no dispositivo para discurso de ódio, assédio, ameaças, assédio sexual e autolesão em oito idiomas: inglês, espanhol, português, francês, alemão, italiano, polonês e holandês. Quando a cabeça de ódio dispara, dez cabeças de alvo identificam qual grupo protegido é visado pelo texto: raça, cor, religião, ascendência, origem nacional ou étnica, orientação sexual, gênero, deficiência, idade ou outro.
O diferencial é tamanho contra qualidade. O Toxic supera o Llama-Guard-3-1B e o Qwen3Guard-Gen-0.6B em 13 a 17 pontos de macro F1 nos sete idiomas da UE, e o Detoxify em 30, com uma fração do espaço em disco (75,5 MB LiteRT, 66,7 MB Core ML, contra cerca de 500 MB a 1 GB dos guard models). Os dados de treinamento são comercialmente limpos (apenas CC0, CC-BY, MIT, Apache-2.0), então ele pode ser distribuído num produto sem a exposição de licenciamento de corpora de discurso de ódio extraídos da web.
Desempenho
Supera o Llama-Guard-3-1B e o Qwen3Guard-Gen-0.6B em 13 a 17 pontos de macro F1 nos sete idiomas da UE, sendo 6 a 14 vezes menor: 75,5 MB em LiteRT contra 500 MB a 1 GB dos guard models.
Macro F1 no limiar 0,40 pelo mesmo harness HateCheck (interno). A coluna 7 UE é a média em espanhol, português, francês, alemão, italiano, polonês e holandês. O Toxic vence de forma absoluta em 7 de 8 idiomas; o Llama-Guard só lidera em inglês.
| Modelo | F1 7 UE | F1 EN | Tamanho |
|---|---|---|---|
| Toxic (LiteRT int4) | 0,786 | 0,787 | 75,5 MB |
| Toxic (Core ML 4-bit) | 0,777 | 0,771 | 66,7 MB |
| Qwen3Guard-Gen-0.6B (bf16) | 0,652 | 0,770 | server |
| Llama-Guard-3-1B (bf16) | 0,649 | 0,814 | server |
| Llama-Guard-3-1B (int4) | 0,633 | 0,794 | 955 MB |
| Qwen3Guard-Gen-0.6B (int4) | 0,622 | 0,750 | 484 MB |
| Detoxify multilingual (fp32) | 0,487 | 0,642 | ~280 MB |
Avaliação interna na suíte HateCheck (cerca de 3.700 casos de teste escritos à mão por idioma), nunca usada em treinamento. Concorrentes reexecutados no mesmo harness.
Casos de uso
Triagem antes do envio em mensagens
Pontue mensagens de saída no dispositivo antes que elas deixem o celular, para que conteúdo de ódio, ameaça ou assédio possa acionar um aviso em linha ou um caminho de revisão sem nunca chegar aos seus servidores.
Triagem de comentários sem servidor
Passe cada comentário recebido pelo Toxic localmente no cliente, sinalize o provável discurso de ódio para uma fila de moderadores e escale apenas o texto sinalizado para um humano. Reduz o volume que precisa de moderação central sem uma chamada à nuvem por mensagem.
Encaminhe sinais de autolesão e ameaça para ajuda
As cabeças de autolesão e de ameaça são separadas da cabeça de ódio, então um cliente pode exibir um recurso de crise ou um caminho de escalonamento sem confundir nenhum dos sinais com ódio.
Oito idiomas num único modelo
Um único artefato de 75 MB cobre inglês, espanhol, português, francês, alemão, italiano, polonês e holandês. Uma integração para oito idiomas, sem pipeline por idioma e sem uma etapa separada de detecção de idioma.
O que ele faz
- Cinco cabeças de conteúdo multirrótulo: ódio, assédio, ameaça, sexual, autolesão.
- Dez cabeças de alvo sobre a cabeça de ódio: raça, cor, religião, ascendência, origem nacional ou étnica, orientação sexual, gênero, deficiência, idade, outro.
- Oito idiomas a partir de um único artefato: inglês, espanhol, português, francês, alemão, italiano, polonês, holandês. Um menu de limiares por idioma vem nos metadados do modelo.
- Treinado apenas com corpora de licença permissiva (CC0, CC-BY, MIT, Apache-2.0), então pode ser distribuído num produto comercial.
- Roda inteiramente no dispositivo: 66,7 MB em Core ML (4 bits, otimizado para o Apple Neural Engine) ou 75,5 MB em LiteRT (int4 blockwise-32).
Especificações
- Idiomas
- 8: inglês, espanhol, português, francês, alemão, italiano, polonês, holandês
- Tamanho no dispositivo
- 66,7 MB em Core ML (4 bits); 75,5 MB em LiteRT (int4 blockwise-32)
- Backbone
- XLM-R-base com vocabulário reduzido de 60.728 peças, 12 camadas, hidden 768, ~133M de parâmetros
- Precisão
- 0,786 de macro F1 em 8 idiomas (LiteRT int4), 0,777 (Core ML 4 bits)
Um auxílio à triagem de moderação, não um veredito: encaminhe as sinalizações para um revisor humano ou uma camada local mais robusta, em vez de remover automaticamente. Sob testes adversariais, o Toxic pode sinalizar contradiscurso, ódio negado, insultos reapropriados e menções curtas a identidades numa parcela significativa dos casos, especialmente em inglês e alemão. Para holandês, alemão e polonês, combine-o com uma lista de insultos por idioma para capturar termos isolados que ele deixa passar.
FAQ
O que é o Toxic?
Classificador multirrótulo no dispositivo que sinaliza conteúdo de ódio, assédio, ameaça, sexual e de autolesão em inglês, espanhol, português, francês, alemão, italiano, polonês e holandês, para que textos suspeitos possam ser triados antes de sair do dispositivo.
O Toxic roda no dispositivo?
Sim. O Toxic roda inteiramente no dispositivo: a inferência acontece localmente, sem chamada a servidor, então os dados nunca saem do dispositivo.
O Toxic já está disponível?
O Toxic está em beta fechado. Você pode solicitar acesso antecipado na página dele.
Quanto custa o Toxic?
Cada modelo é grátis para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por usuário. Fale conosco para licenças personalizadas.
Qual a precisão e a velocidade do Toxic?
Supera o Llama-Guard-3-1B e o Qwen3Guard-Gen-0.6B em 13 a 17 pontos de macro F1 nos sete idiomas da UE, sendo 6 a 14 vezes menor: 75,5 MB em LiteRT contra 500 MB a 1 GB dos guard models.
Acesso antecipado
Conte o que você está construindo e nós ajudamos você a começar.