Ear
Identification de la langue parlée sur l'appareil, parmi 99 langues, à partir de quelques secondes d'audio, avant que la transcription ne commence.

Identifiez la langue parlée à partir de 30 secondes d'audio.
Une note vocale arrive et le transcripteur est réglé sur l'anglais. Au bout de 30 secondes, Ear dit portugais, et le transcripteur qui s'exécute ensuite est le portugais, au lieu d'un transcripteur anglais qui renverrait des absurdités avec assurance.
Ear n'écoute pas tout le fichier. Ear trouve les trois passages de trente secondes qui ressemblent le plus à de la parole, saute le jingle et le silence, et nomme la langue en 250 ms. La réponse arrive avec un indice de confiance et un indicateur qui dit s'il faut s'y fier.
Quand les deux premiers candidats sont trop proches pour être séparés, Ear le dit. Vous demandez à l'utilisateur ou vous repliez sur un modèle général au lieu de transcrire dans la mauvaise langue. Un seul SDK, toutes les plateformes : Swift sur Apple, Kotlin sur Android, JavaScript dans le navigateur et Node. Rien n'est envoyé.
Le bon transcripteur, 98,5 % du temps.
Sur 162 enregistrements, 98,5 % des réponses qu'Ear a marquées fiables ont été routées vers le bon transcripteur ; sur 12 envois ordinaires et 10 reconstruits en podcasts, aucune réponse confiante n'était fausse.
Mesuré de bout en bout à travers le SDK et publié sur la fiche du modèle. La parole mêlée à une musique plus forte est lue correctement environ 60 % du temps.
Cas d'usage
Identifiez la langue parlée à partir de 30 secondes d'audio.
Choisir le bon transcripteur d'abord
Un transcripteur pointé sur la mauvaise langue renvoie des absurdités avec assurance. Dans un enregistreur de réunions ou une app de notes vocales, exécutez Ear sur les 30 premières secondes et démarrez le transcripteur, les sous-titres et la traduction dans la langue réellement parlée.
Trier une archive d'enregistrements
Passez une bibliothèque de notes vocales, d'appels ou d'épisodes par Ear dans un script Node ou une app Mac pendant la nuit, et chaque fichier a sa langue au matin. Rien n'est envoyé et rien n'est facturé par fichier.
Router un appel ou un message vocal
Dans une app de support ou un produit de messagerie, nommez la langue d'un appel entrant ou d'un message vocal avant qu'il n'atteigne une personne. L'appel arrive chez quelqu'un qui la parle, ou chez le bon modèle de parole.
Sous-titrer dans le navigateur
Un outil vidéo web identifie la langue parlée côté client, avec le même SDK dans le navigateur et dans Node, et choisit la langue des sous-titres pour que la personne qui envoie n'ait jamais à le faire.
Inspiration
Des idées à construire avec Ear. Copiez un prompt dans votre agent de code et lancez-vous.
Detect a caller's language and route the voicemail.
Sort an archive of recordings by spoken language.
Detect the language of a voice note, then transcribe with the right model.
Pick the dominant language of a recording to route it.
Detect the language of a voicemail or dictation before transcribing.
Gate transcription so it only runs on languages you support.
Ce que fait le modèle
- 99 langues, de l'afrikaans au yoruba, dont les grandes langues européennes, asiatiques et africaines.
- Choisit les trois fenêtres de trente secondes qui ressemblent le plus à de la parole plutôt que de lire par position, si bien qu'une intro musicale ou un passage silencieux ne le trompe pas. Choisir par position trouve la langue 4 % du temps sur un enregistrement de cinq minutes dont un dixième est de la parole.
- Renvoie la langue, un indice de confiance, les candidats classés et un indicateur
isReliable. L'indicateur est faux quand les deux premiers sont trop proches pour trancher, et faux pour le norvégien, le suédois et le danois, que le modèle confond entre eux. - Un audio déjà décodé fonctionne à n'importe quelle fréquence d'échantillonnage ; une URL de fichier fonctionne sur Apple.
- Les poids se téléchargent à la première utilisation et sont mis en cache ; la construction ne fait aucun travail et ne lance aucun téléchargement.
Prise en main
Ajoutez détection de langue parlée à votre application iOS or macOS, Android or web en quelques lignes de code. Docs Ear.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
import Ear
let ear = Ear() // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS). What it does: Ear : identification de la langue parlée sur l'appareil. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0") // target dependency .product(name: "Ear", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.5.0")
import ai.desertant.ear.Ear
val ear = Ear(context) // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language // "pt"
detection.isReliable // true
ear.close()
Add Ear from Desert Ant Labs to this Kotlin project (Android).
What it does: Ear : identification de la langue parlée sur l'appareil.
SDK:
Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.5.0")
Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt
Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/ear @litertjs/core # browser
npm i @desert-ant-labs/ear # Node
import { Ear } from "@desert-ant-labs/ear";
const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: Ear : identification de la langue parlée sur l'appareil. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/ear @litertjs/core # browser npm i @desert-ant-labs/ear # Node Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Spécifications
- Langues
- 99
- Entrée
- Trois fenêtres de trente secondes de l'enregistrement ; n'importe quelle fréquence d'échantillonnage
- Vitesse
- 250 ms par identification, trois fenêtres
- Plateformes
- iOS, macOS, tvOS, visionOS (Core ML) ; Android, Linux, Windows (LiteRT) ; navigateur (WebAssembly et LiteRT.js) ; Node
Ear nomme la langue ; il ne transcrit pas. La parole sous une musique plus forte est bien lue environ six fois sur dix, et le norvégien, le suédois et le danois sont confondus entre eux : Ear marque donc ces réponses comme non fiables, par conception.
Les enregistrements de moins de 30 secondes n'obtiennent qu'une fenêtre et une réponse moins certaine. Traitez une réponse non fiable comme une question à poser à l'utilisateur, pas comme un réglage de transcripteur.
FAQ
Qu'est-ce que Ear ?
Identification de la langue parlée sur l'appareil, parmi 99 langues, à partir de quelques secondes d'audio, avant que la transcription ne commence.
Ear fonctionne-t-il sur l'appareil ?
Oui. Ear s'exécute sur l'appareil, sans appel serveur : les données restent chez l'utilisateur.
Quelles plateformes Ear prend-il en charge ?
Ear est livré sous forme de SDK natif sur l'appareil pour Swift, Kotlin, JavaScript / TypeScript.
Combien coûte Ear ?
Chaque modèle est gratuit jusqu'à 100k appareils actifs mensuels. L'inférence est illimitée. Contactez-nous pour des licences sur mesure.
Quelle est la précision ou la vitesse de Ear ?
Sur 162 enregistrements, 98,5 % des réponses qu'Ear a marquées fiables ont été routées vers le bon transcripteur ; sur 12 envois ordinaires et 10 reconstruits en podcasts, aucune réponse confiante n'était fausse.