Desert Ant Labs

Toxic: deteção multilingue de discurso de ódio no dispositivo

Moderação de conteúdosBeta fechada

Classificador multi-rótulo no dispositivo que assinala conteúdo de ódio, assédio, ameaça, sexual e de autolesão em inglês, espanhol, português, francês, alemão, italiano, polaco e neerlandês, para que texto suspeito possa ser triado antes de sair do dispositivo.

O Toxic é um classificador multi-rótulo no dispositivo para discurso de ódio, assédio, ameaças, assédio sexual e autolesão em oito línguas: inglês, espanhol, português, francês, alemão, italiano, polaco e neerlandês. Quando a cabeça de ódio dispara, dez cabeças de alvo identificam qual o grupo protegido visado pelo texto: raça, cor, religião, ascendência, origem nacional ou étnica, orientação sexual, género, deficiência, idade ou outro.

A vantagem é tamanho contra qualidade. O Toxic supera o Llama-Guard-3-1B e o Qwen3Guard-Gen-0.6B em 13 a 17 pontos de macro F1 nas sete línguas da UE, e o Detoxify em 30, com uma fração do espaço em disco (75,5 MB LiteRT, 66,7 MB Core ML, contra cerca de 500 MB a 1 GB dos guard models). Os dados de treino são comercialmente limpos (apenas CC0, CC-BY, MIT, Apache-2.0), por isso pode ser lançado num produto sem a exposição de licenciamento de corpora de discurso de ódio recolhidos da web.

O Toxic está em beta fechada. O model card e os pesos são públicos. Acesso antecipado mediante pedido.

Desempenho

Supera o Llama-Guard-3-1B e o Qwen3Guard-Gen-0.6B em 13 a 17 pontos de macro F1 nas sete línguas da UE, sendo 6 a 14 vezes menor: 75,5 MB em LiteRT contra 500 MB a 1 GB dos guard models.

0,786
Macro F1
0,881
Recall de ódio
66,7 MB
No dispositivo
2,82 ms
Por passagem

Macro F1 no limiar 0,40 pelo mesmo harness HateCheck (interno). A coluna 7 UE é a média em espanhol, português, francês, alemão, italiano, polaco e neerlandês. O Toxic vence de forma absoluta em 7 das 8 línguas; o Llama-Guard só lidera em inglês.

ModeloF1 7 UEF1 ENTamanho
Toxic (LiteRT int4)0,7860,78775,5 MB
Toxic (Core ML 4-bit)0,7770,77166,7 MB
Qwen3Guard-Gen-0.6B (bf16)0,6520,770server
Llama-Guard-3-1B (bf16)0,6490,814server
Llama-Guard-3-1B (int4)0,6330,794955 MB
Qwen3Guard-Gen-0.6B (int4)0,6220,750484 MB
Detoxify multilingual (fp32)0,4870,642~280 MB

Avaliação interna na suite HateCheck (cerca de 3700 casos de teste escritos à mão por língua), nunca usada em treino. Concorrentes reexecutados no mesmo harness.

Casos de uso

Triagem antes do envio em mensagens

Avalie as mensagens de saída no dispositivo antes de estas saírem do telemóvel, para que conteúdo de ódio, ameaça ou assédio possa acionar um aviso em linha ou um caminho de revisão sem chegar aos seus servidores.

Triagem de comentários sem servidor

Passe cada comentário recebido pelo Toxic localmente no cliente, assinale o provável discurso de ódio para uma fila de moderadores e envie apenas o texto assinalado para um humano. Reduz o volume que precisa de moderação central sem uma chamada à nuvem por mensagem.

Encaminhar sinais de autolesão e ameaça para ajuda

As cabeças de autolesão e de ameaça são separadas da cabeça de ódio, por isso um cliente pode apresentar um recurso de crise ou um caminho de escalonamento sem confundir nenhum dos sinais com ódio.

Oito línguas num único modelo

Um único artefacto de 75 MB cobre inglês, espanhol, português, francês, alemão, italiano, polaco e neerlandês. Uma integração para oito línguas, sem pipeline por língua e sem uma etapa separada de deteção de língua.

O que faz

  • Cinco cabeças de conteúdo multi-rótulo: ódio, assédio, ameaça, sexual, autolesão.
  • Dez cabeças de alvo sobre a cabeça de ódio: raça, cor, religião, ascendência, origem nacional ou étnica, orientação sexual, género, deficiência, idade, outro.
  • Oito línguas a partir de um único artefacto: inglês, espanhol, português, francês, alemão, italiano, polaco, neerlandês. Um menu de limiares por língua vem nos metadados do modelo.
  • Treinado apenas com corpora de licença permissiva (CC0, CC-BY, MIT, Apache-2.0), por isso pode ser lançado num produto comercial.
  • Executado inteiramente no dispositivo: 66,7 MB em Core ML (4 bits, otimizado para o Apple Neural Engine) ou 75,5 MB em LiteRT (int4 blockwise-32).

Especificações

Línguas
8: inglês, espanhol, português, francês, alemão, italiano, polaco, neerlandês
Tamanho no dispositivo
66,7 MB em Core ML (4 bits); 75,5 MB em LiteRT (int4 blockwise-32)
Backbone
XLM-R-base com vocabulário reduzido de 60 728 peças, 12 camadas, hidden 768, ~133M de parâmetros
Precisão
0,786 de macro F1 em 8 línguas (LiteRT int4), 0,777 (Core ML 4 bits)

Um auxiliar de triagem para moderação, não uma decisão: encaminhe as sinalizações para um revisor humano ou uma camada local mais pesada, em vez de remover automaticamente. Em testes adversariais, o Toxic pode assinalar contradiscurso, ódio negado, insultos reapropriados e menções curtas a identidades numa parcela significativa dos casos, sobretudo em inglês e alemão. Para neerlandês, alemão e polaco, combine-o com uma lista de insultos por língua para apanhar termos isolados que lhe escapam.

FAQ

O que é o Toxic?

Classificador multi-rótulo no dispositivo que assinala conteúdo de ódio, assédio, ameaça, sexual e de autolesão em inglês, espanhol, português, francês, alemão, italiano, polaco e neerlandês, para que texto suspeito possa ser triado antes de sair do dispositivo.

O Toxic é executado no dispositivo?

Sim. O Toxic é executado inteiramente no dispositivo: a inferência acontece localmente, sem qualquer chamada a servidores, por isso os dados nunca saem do dispositivo.

O Toxic já está disponível?

O Toxic está em beta fechada. Pode pedir acesso antecipado na respetiva página.

Quanto custa o Toxic?

Todos os modelos são gratuitos para até 100k dispositivos ativos mensais por SDK. Inferência ilimitada por utilizador. Contacte-nos para licenças personalizadas.

Qual é a precisão ou a rapidez do Toxic?

Supera o Llama-Guard-3-1B e o Qwen3Guard-Gen-0.6B em 13 a 17 pontos de macro F1 nas sete línguas da UE, sendo 6 a 14 vezes menor: 75,5 MB em LiteRT contra 500 MB a 1 GB dos guard models.

Acesso antecipado

Diga-nos o que está a construir e ajudamo-lo a começar.