Desert Ant Labs

Toxic: 온디바이스 다국어 혐오 표현 탐지

콘텐츠 모더레이션비공개 베타

영어, 스페인어, 포르투갈어, 프랑스어, 독일어, 이탈리아어, 폴란드어, 네덜란드어 전반에서 혐오, 괴롭힘, 위협, 성적, 자해 콘텐츠를 표시하는 온디바이스 다중 라벨 분류기로, 문제 소지가 있는 텍스트가 기기를 벗어나기 전에 분류할 수 있습니다.

Toxic은 8개 언어(영어, 스페인어, 포르투갈어, 프랑스어, 독일어, 이탈리아어, 폴란드어, 네덜란드어) 전반에서 혐오 표현, 괴롭힘, 위협, 성적 괴롭힘, 자해를 다루는 온디바이스 다중 라벨 분류기입니다. 혐오 헤드가 활성화되면, 10개 대상 헤드가 텍스트가 겨냥하는 보호 대상 근거를 식별합니다. 인종, 피부색, 종교, 혈통, 국가나 민족 기원, 성적 지향, 성별, 장애, 나이, 그 외입니다.

강점은 크기 대비 품질입니다. Toxic은 7개 EU 언어에서 Llama-Guard-3-1B와 Qwen3Guard-Gen-0.6B를 매크로 F1 기준 13~17점, Detoxify를 30점 앞서며, 디스크 사용량은 이들의 일부에 불과합니다(75.5 MB LiteRT, 66.7 MB Core ML 대 가드 모델 빌드의 약 500 MB~1 GB). 학습 데이터는 상업적으로 깨끗하므로(CC0, CC-BY, MIT, Apache-2.0만 사용), 스크래핑한 혐오 표현 코퍼스의 라이선스 노출 없이 제품에 넣을 수 있습니다.

Toxic은(는) 비공개 베타 단계입니다. 모델 카드와 가중치는 공개되어 있습니다. 얼리 액세스는 요청 시 제공됩니다.

성능

7개 EU 언어에서 Llama-Guard-3-1B와 Qwen3Guard-Gen-0.6B를 매크로 F1 기준 13~17점 앞서면서, 크기는 6~14배 작습니다. 75.5 MB LiteRT 대 가드 모델 빌드의 500 MB~1 GB입니다.

0.786
매크로 F1
0.881
혐오 재현율
66.7 MB
온디바이스
2.82 ms
포워드당

동일한 HateCheck 하니스, 임계값 0.40에서의 매크로 F1 (내부). 7-EU 열은 스페인어, 포르투갈어, 프랑스어, 독일어, 이탈리아어, 폴란드어, 네덜란드어의 평균입니다. Toxic이 8개 언어 중 7개에서 확실히 앞서고, Llama-Guard는 영어에서만 우세합니다.

모델7-EU F1EN F1크기
Toxic (LiteRT int4)0.7860.78775.5 MB
Toxic (Core ML 4-bit)0.7770.77166.7 MB
Qwen3Guard-Gen-0.6B (bf16)0.6520.770server
Llama-Guard-3-1B (bf16)0.6490.814server
Llama-Guard-3-1B (int4)0.6330.794955 MB
Qwen3Guard-Gen-0.6B (int4)0.6220.750484 MB
Detoxify multilingual (fp32)0.4870.642~280 MB

학습에 사용된 적 없는 HateCheck 스위트(언어당 약 3,700개 수작업 테스트 케이스)에 대한 내부 평가. 경쟁 모델도 동일한 하니스로 다시 실행되었습니다.

활용 사례

메시징에서 전송 전 분류

휴대폰을 벗어나기 전에 발신 메시지를 기기에서 점수화하여, 혐오, 위협, 괴롭힘 콘텐츠가 서버에 닿지 않고도 인라인 경고나 검토 경로를 띄울 수 있습니다.

서버 없는 댓글 분류

들어오는 모든 댓글을 클라이언트에서 Toxic으로 로컬 실행하여 혐오 표현 가능성이 있는 것을 모더레이터 큐로 표시하고, 표시된 텍스트만 사람에게 에스컬레이션합니다. 메시지마다 클라우드를 호출하지 않고도 중앙 모더레이션이 처리할 양을 줄여줍니다.

자해와 위협 신호를 도움 경로로 라우팅

자해와 위협 헤드는 혐오 헤드와 분리되어 있어, 어느 신호도 혐오와 뒤섞지 않고 클라이언트가 위기 대응 자원이나 에스컬레이션 경로를 제시할 수 있습니다.

하나의 모델로 8개 언어

단일 75 MB 아티팩트로 영어, 스페인어, 포르투갈어, 프랑스어, 독일어, 이탈리아어, 폴란드어, 네덜란드어를 다룹니다. 언어별 파이프라인이나 별도의 언어 감지 단계 없이, 통합 하나로 8개 언어를 처리합니다.

기능 소개

  • 5개 다중 라벨 콘텐츠 헤드: 혐오, 괴롭힘, 위협, 성적, 자해.
  • 혐오 헤드 위에 10개 대상 헤드: 인종, 피부색, 종교, 혈통, 국가나 민족 기원, 성적 지향, 성별, 장애, 나이, 그 외.
  • 단일 아티팩트로 8개 언어: 영어, 스페인어, 포르투갈어, 프랑스어, 독일어, 이탈리아어, 폴란드어, 네덜란드어. 언어별 임계값 메뉴는 모델 메타데이터에 함께 포함됩니다.
  • 관대한 라이선스 코퍼스(CC0, CC-BY, MIT, Apache-2.0)만으로 학습되어, 상업 제품에 출시할 수 있습니다.
  • 완전히 기기에서 실행됩니다: 66.7 MB Core ML (4-bit, ANE 최적화) 또는 75.5 MB LiteRT (int4 blockwise-32).

사양

언어
8개: 영어, 스페인어, 포르투갈어, 프랑스어, 독일어, 이탈리아어, 폴란드어, 네덜란드어
온디바이스 크기
66.7 MB Core ML (4-bit); 75.5 MB LiteRT (int4 blockwise-32)
백본
XLM-R-base, 6만 728개로 정리한 어휘, 12개 레이어, 은닉 768, 약 133M 파라미터
정확도
8개 언어 매크로 F1 0.786 (LiteRT int4), 0.777 (Core ML 4-bit)

판정이 아니라 모더레이션 분류 보조 도구입니다. 자동 삭제 대신, 표시된 항목을 사람 검토자나 더 무거운 로컬 계층으로 에스컬레이션하십시오. 적대적 테스트에서 Toxic은 반대 발언, 부정된 혐오, 재전유된 비속어, 짧은 정체성 언급을 유의미한 비율로 잘못 표시할 수 있으며, 특히 영어와 독일어에서 그렇습니다. 네덜란드어, 독일어, 폴란드어의 경우 단독 비속어를 놓치는 문제를 잡기 위해 언어별 비속어 단어 목록과 함께 사용하십시오.

자주 묻는 질문

Toxic은(는) 무엇인가요?

영어, 스페인어, 포르투갈어, 프랑스어, 독일어, 이탈리아어, 폴란드어, 네덜란드어 전반에서 혐오, 괴롭힘, 위협, 성적, 자해 콘텐츠를 표시하는 온디바이스 다중 라벨 분류기로, 문제 소지가 있는 텍스트가 기기를 벗어나기 전에 분류할 수 있습니다.

Toxic은(는) 온디바이스로 실행되나요?

네. Toxic은(는) 전적으로 기기에서 실행됩니다. 추론이 서버 호출 없이 로컬에서 이루어지므로 데이터가 기기를 벗어나지 않습니다.

Toxic은(는) 지금 사용할 수 있나요?

Toxic은(는) 비공개 베타 단계입니다. 해당 페이지에서 얼리 액세스를 요청할 수 있습니다.

Toxic의 비용은 얼마인가요?

모든 모델은 SDK당 월간 활성 기기 10만 대까지 무료입니다. 사용자당 추론은 무제한입니다. 맞춤 라이선스는 문의하기 바랍니다.

Toxic은(는) 얼마나 정확하고 빠른가요?

7개 EU 언어에서 Llama-Guard-3-1B와 Qwen3Guard-Gen-0.6B를 매크로 F1 기준 13~17점 앞서면서, 크기는 6~14배 작습니다. 75.5 MB LiteRT 대 가드 모델 빌드의 500 MB~1 GB입니다.

얼리 액세스

무엇을 만들고 계신지 알려주시면 설정을 도와드리겠습니다.