Ear
Herkenning van gesproken taal op het apparaat, in 99 talen, uit een korte flard audio, voordat de transcriptie begint.

Herken de gesproken taal uit 30 seconden audio.
Er komt een spraaknotitie binnen en de transcriber staat op Engels. Na 30 seconden zegt Ear Portugees, en de transcriber die daarna draait is de Portugese in plaats van een Engelse die met stelligheid onzin teruggeeft.
Ear luistert niet naar het hele bestand. Ear vindt de drie stukken van dertig seconden die het meest op spraak lijken, slaat de jingle en de stilte over, en benoemt de taal in 250 ms. Het antwoord komt met een betrouwbaarheid en een vlag die zegt of je het kunt vertrouwen.
Als de bovenste twee kandidaten te dicht bij elkaar liggen om te scheiden, zegt Ear dat. Je vraagt het aan de gebruiker of valt terug op een algemeen model in plaats van in de verkeerde taal te transcriberen. Eén SDK, elk platform: Swift op Apple, Kotlin op Android, JavaScript in de browser en Node. Er wordt niets geüpload.
De juiste transcriber, in 98,5% van de gevallen.
Op 162 opnames routeerde 98,5% van de antwoorden die Ear als betrouwbaar markeerde naar de juiste transcriber; bij 12 gewone uploads en 10 als podcast opnieuw opgebouwde opnames was geen enkel zeker antwoord fout.
End-to-end gemeten via de SDK en gepubliceerd op de model card. Spraak die onder luidere muziek is gemengd, wordt ongeveer 60% van de tijd goed gelezen.
Toepassingen
Herken de gesproken taal uit 30 seconden audio.
Kies eerst de juiste transcriber
Een transcriber die op de verkeerde taal staat, geeft met stelligheid onzin terug. Draai Ear in een vergaderrecorder of een spraaknotitie-app op de eerste 30 seconden en start de transcriber, de ondertitels en de vertaling in de taal die daadwerkelijk wordt gesproken.
Een archief met opnames sorteren
Draai Ear 's nachts over een bibliotheek met spraaknotities, gesprekken of afleveringen in een Node-script of een Mac-app, en elk bestand heeft 's ochtends zijn taal. Er wordt niets geüpload en niets per bestand afgerekend.
Een gesprek of voicemail routeren
Benoem in een support-app of een berichtenproduct de taal van een binnenkomend gesprek of een voicemail voordat het een persoon bereikt. Het gesprek komt terecht bij iemand die de taal spreekt, of bij het juiste spraakmodel.
Ondertitelen in de browser
Een webvideotool herkent de gesproken taal client-side, met dezelfde SDK in de browser en in Node, en kiest de ondertiteltaal, zodat de uploader dat nooit hoeft.
Inspiratie
Ideeën om te bouwen met Ear. Kopieer een prompt naar je coding-agent en ga.
Detect a caller's language and route the voicemail.
Sort an archive of recordings by spoken language.
Detect the language of a voice note, then transcribe with the right model.
Pick the dominant language of a recording to route it.
Detect the language of a voicemail or dictation before transcribing.
Gate transcription so it only runs on languages you support.
Wat het model doet
- 99 talen, van Afrikaans tot Yoruba, waaronder de grote Europese, Aziatische en Afrikaanse talen.
- Kiest de drie vensters van dertig seconden die het meest op spraak lijken in plaats van te lezen op positie, zodat een muziekintro of een stille passage het niet voor de gek houdt. Kiezen op positie vindt de taal in 4% van de gevallen bij een opname van vijf minuten met spraak in een tiende ervan.
- Geeft de taal terug, een betrouwbaarheid, de gerangschikte kandidaten en een
isReliable-vlag. De vlag is false als de bovenste twee te dicht bij elkaar liggen, en false voor Noors, Zweeds en Deens, die het model met elkaar verwart. - Al gedecodeerde audio met elke samplerate werkt; een bestands-URL werkt op Apple.
- De gewichten worden bij het eerste gebruik gedownload en gecachet; het aanmaken doet geen werk en start geen download.
Aan de slag
Voeg gesproken taalherkenning toe aan je iOS or macOS, Android or web-app in een paar regels code. Ear docs.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Ear", package: "desert-ant-core")
import Ear
let ear = Ear() // downloads on first use
let detection = try await ear.identify(contentsOf: url)
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this Swift project (iOS, macOS). What it does: on-device herkenning van gesproken taal. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0") // target dependency .product(name: "Ear", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.5.0")
import ai.desertant.ear.Ear
val ear = Ear(context) // downloads on first use
val detection = ear.identify(samples, 16_000.0)
detection.language // "pt"
detection.isReliable // true
ear.close()
Add Ear from Desert Ant Labs to this Kotlin project (Android).
What it does: on-device herkenning van gesproken taal.
SDK:
Kotlin (Android)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// build.gradle.kts (Maven Central)
implementation("ai.desertant:ear:3.5.0")
Reference:
- Model page: https://desertant.com/models/ear/
- Full catalog and other models: https://desertant.com/llms.txt
Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/ear @litertjs/core # browser
npm i @desert-ant-labs/ear # Node
import { Ear } from "@desert-ant-labs/ear";
const ear = await Ear.load();
const detection = await ear.identify(samples, 16000);
detection.language // "pt"
detection.isReliable // true
Add Ear from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: on-device herkenning van gesproken taal. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/ear @litertjs/core # browser npm i @desert-ant-labs/ear # Node Reference: - Model page: https://desertant.com/models/ear/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Specs
- Talen
- 99
- Invoer
- Drie vensters van dertig seconden uit de opname; elke samplerate
- Snelheid
- 250 ms per identificatie, drie vensters
- Platforms
- iOS, macOS, tvOS, visionOS (Core ML); Android, Linux, Windows (LiteRT); browser (WebAssembly en LiteRT.js); Node
Ear benoemt de taal; het transcribeert niet. Spraak onder luidere muziek wordt ongeveer zes van de tien keer goed gelezen, en Noors, Zweeds en Deens worden met elkaar verward, dus Ear markeert die bewust als onbetrouwbaar.
Opnames korter dan 30 seconden krijgen één venster en een minder zeker antwoord. Behandel een onbetrouwbaar antwoord als een vraag aan de gebruiker, niet als een instelling voor de transcriber.
FAQ
Wat is Ear?
Herkenning van gesproken taal op het apparaat, in 99 talen, uit een korte flard audio, voordat de transcriptie begint.
Draait Ear op het apparaat?
Ja. Ear draait op het apparaat, zonder serveraanroep, dus de data blijft bij de gebruiker.
Welke platforms ondersteunt Ear?
Ear wordt geleverd als een native on-device SDK voor Swift, Kotlin, JavaScript / TypeScript.
Hoeveel kost Ear?
Elk model is gratis voor maximaal 100k maandelijks actieve apparaten. Inference is onbeperkt. Neem contact op voor aangepaste licenties.
Hoe nauwkeurig of snel is Ear?
Op 162 opnames routeerde 98,5% van de antwoorden die Ear als betrouwbaar markeerde naar de juiste transcriber; bij 12 gewone uploads en 10 als podcast opnieuw opgebouwde opnames was geen enkel zeker antwoord fout.