Desert Ant Labs

Voz

SpraakherkenningBeschikbaar

Transcribeer 10 minuten audio in 2s op een iPhone, 14x sneller dan Whisper, met precieze woordtijdstempels.

Transcribeer 10 minuten in 2 seconden.

Transcribeer een audio- of videobestand met Voz en krijg precieze begin- en eindtijden voor elk woord. 10 minuten kost 2s op een iPhone, op het apparaat, dus er wordt niets geüpload en niets per minuut afgerekend.

Op Apple silicon draait het model op de Neural Engine, dus transcriberen is razendsnel en verbruikt minder stroom. Op een Mac gaat een backcatalogus met podcasts, interviews en colleges er in één pass doorheen, en er wordt niets geüpload.

De tijdstempels zijn precies genoeg om op te monteren. Woordbegin landt binnen 83 ms van een forced aligner en woordeinde binnen 95 ms, voor precieze montage op basis van het transcript. Voz is een voor de Apple Neural Engine geoptimaliseerde versie van NVIDIA's Parakeet TDT 0.6B v3, met een nauwkeurigheid die op de meeste audio vergelijkbaar is met Whisper large-v3-turbo, en met een downloadgrootte van slechts 467 MB.

14x sneller dan Whisper.

10 minuten voordracht in 2s op een iPhone 17 Pro, 1,2s op een iPhone 18 Pro en 2,1s op een iPhone 15 Pro. Op een M3 Ultra 14x sneller dan whisper.cpp large-v3-turbo op dezelfde podcast van 10 minuten, met een woordfoutpercentage van 7,40% op zes publieke Engelse sets waar Whisper 7,00% scoort.

0.0s
0:00 / 10:00

Audio: Ant Ventures, een LibriVox-opname, publiek domein.

2s
10 minuten audio
iPhone 17 Pro, op de Neural Engine
14x
Sneller dan Whisper
large-v3-turbo via whisper.cpp, 10 min, M3 Ultra
7,40%
Woordfoutpercentage
zes Open ASR Leaderboard-sets; Whisper large-v3-turbo 7,00%
467MB
Op schijf
Whisper large-v3-turbo: 1,6 GB bij fp16

Tijd om 10 minuten audio te transcriberen.

ApparaatTijdRealtime
M3 Ultra0,8s762x
iPhone 18 Pro1,2s492x
M4 Max1,3s453x
iPhone 17 Pro1,8s334x
iPhone 15 Pro2,1s283x
M1 Mac mini2,4s251x

Woordfoutpercentage op de Open ASR Leaderboard-datasets, Voz met zijn eigen tekstnormalisator, de cijfers van Whisper uit het leaderboard

DatasetVozWhisper large-v3-turbo
LibriSpeech test-clean2,19%2,13%
LibriSpeech test-other3,86%3,70%
GigaSpeech9,70%8,47%
SPGISpeech3,86%2,79%
Earnings-2212,97%11,07%
AMI11,84%13,87%
Average7,40%7,00%

Lees de rij die bij jouw audio past. Schone, dichtbij opgenomen spraak komt rond 2 tot 4% uit (LibriSpeech, SPGISpeech), podcasts en webvideo rond 10% (GigaSpeech), en vergaderruimtes en telefoongesprekken 12 tot 13% (AMI, Earnings-22), en daar verslaat het model Whisper. Cijfers per taal, elk op 10 minuten voorgelezen spraak, staan op de model card, van 3,31% voor Italiaans tot 39,46% voor Grieks. De iPhone-timings en de vergelijking met whisper.cpp zijn onze eigen runs en staan nog niet op de kaart.

Toepassingen

Transcribeer 10 minuten in 2 seconden.

Transcribeer elk audio- of videobestand

Neem een podcast of een video op en het volledige transcript is klaar voordat de export klaar is. Doorzoekbare tekst met een tijdstempel op elk woord, in elk van 25 talen, zonder het apparaat te verlaten.

Werk een achterstand weg

Een archief met interviews, colleges of vergaderopnames wordt in één pass doorzoekbaar op een Mac. Honderd uur gaat er in 20 minuten doorheen, en er wordt niets geüpload.

Knippen op een woord

Elk woord draagt een begin en een eind, dus een geselecteerd bereik in het transcript is een knip in een video-editor. Combineer het met Clips voor de shorts en Title om ze een naam te geven.

Inspiratie

Ideeën om te bouwen met Voz. Kopieer een prompt naar je coding-agent en ga.

Voz

Build a podcast player that transcribes every episode and makes it searchable, on the device.

Prompt kopiëren
Voz

Build a meeting recorder that hands you a timestamped transcript before you leave the room.

Prompt kopiëren
Voz

Turn voice memos into searchable, editable text notes, offline.

Prompt kopiëren
Voz

Generate SRT subtitles for any video file on the Mac.

Prompt kopiëren
Voz

Add captions to a video player that run on the device.

Prompt kopiëren
Voz

Build an interview app for journalists where sources never leave the phone.

Prompt kopiëren
VozClipsTitle

Build a full podcast studio: transcribe, clip, and title on the device.

Prompt kopiëren
ClearVozClips

Record, clean, transcribe, and clip: a whole creator pipeline, offline.

Prompt kopiëren
Bekijk alle 26 ideeën

Wat het model doet

  • Woordbegin binnen 83 ms en woordeinde binnen 95 ms van een forced aligner, gemiddeld, bij een frameresolutie van 80 ms.
  • 10 minuten audio in 2s op een iPhone 17 Pro, 1,2s op een iPhone 18 Pro en 2,1s op een iPhone 15 Pro. Op een M3 Ultra 0,8s, 762x realtime. Losse korte clips halen 50 tot 62x, omdat elke clip een volledig venster van 15s betaalt.
  • 7,40% woordfoutpercentage gemiddeld over zes Open ASR Leaderboard-sets (Whisper large-v3-turbo: 7,00%), 2,83% op een half uur voordracht (Whisper: 2,72%), 11,84% op AMI-vergaderingen (Whisper: 13,87%).
  • De hele graph draait op de Neural Engine zonder CPU- of GPU-fallback; het piekgeheugen groeit niet mee met de lengte van de opname.
  • 25 talen: Bulgaars, Kroatisch, Tsjechisch, Deens, Nederlands, Engels, Ests, Fins, Frans, Duits, Grieks, Hongaars, Italiaans, Lets, Litouws, Maltees, Pools, Portugees, Roemeens, Russisch, Slowaaks, Sloveens, Spaans, Zweeds en Oekraïens.
  • 467 MB op schijf, op verzoek gedownload en gecachet; de eerste keer laden na een download duurt eenmalig 20s terwijl Core ML specialiseert, daarna 0,2s. Download tijdens de onboarding.
  • Mono-audio met elke samplerate; de SDK resamplet en mixt naar beneden. Langere audio wordt bij pauzes in vensters van 15s geknipt en samengevoegd op de woorden waarover aangrenzende vensters het eens zijn.
  • Gebouwd op NVIDIA's Parakeet TDT 0.6B v3, uitgebracht onder CC BY 4.0. De gewichten zijn ongewijzigd; de conversie, de compressie en de Neural Engine-runtime zijn van ons.

Voorbeeld-app

Clipper

Gebouwd met Voz, Clips, Title

Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.

Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.

macOS 26 or later, Apple Silicon

Installeren met Homebrew
brew tap desert-ant-labs/tap
brew install --cask clipper

Aan de slag

Voeg spraakherkenning toe aan je iOS or macOS or web-app in een paar regels code. Voz docs.

iOS, macOS
Installeren
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
Voorbeeld - Swift
import Voz

let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text                     // the transcript
result.words.first?.start       // 80ms resolution
result.realtimeFactor           // seconds of audio per second of wall clock
Bouwen met een prompt
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: on-device spraak-naar-tekst op de Neural Engine.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/voz/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidBinnenkort
Web, Node.js
Installeren
npm i @desert-ant-labs/voz onnxruntime-web
Voorbeeld - TypeScript
import { Voz } from "@desert-ant-labs/voz";

const voz = await Voz.load();
const result = await voz.transcribe(file);   // File, Blob, ArrayBuffer, or samples
result.text;
result.words[0];        // { text, start, end }
result.realtimeFactor;
Bouwen met een prompt
Add Voz from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js).

What it does: on-device spraak-naar-tekst op de Neural Engine.

SDK:

JavaScript / TypeScript (Web, Node.js)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
npm i @desert-ant-labs/voz onnxruntime-web

Reference:
- Model page: https://desertant.com/models/voz/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.

Specs

Snelheid
10 minuten audio in 0,8s tot 2,4s op Mac en iPhone, 251x tot 762x realtime; tijden per apparaat in Prestaties.
Nauwkeurigheid
7,40% WER over zes Open ASR Leaderboard-sets; 2,83% long-form; woordbegin 83 ms, woordeinde 95 ms gemiddelde fout
Grootte op het apparaat
467 MB gecompileerde Core ML, op verzoek gedownload
Talen
25 Europese talen; nauwkeurigheid van 3,31% (Italiaans) tot 39,46% (Grieks) op voorgelezen spraak
Model
NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), geconverteerd naar Core ML en gecomprimeerd door Desert Ant Labs: log-mel-frontend, conformer-encoder, transducer-decoder, allemaal op de Neural Engine
Platforms
iOS, iPadOS, macOS, tvOS, visionOS (Core ML); browser en Node (WebAssembly, ONNX Runtime)

De snelheid op de Neural Engine is alleen voor Apple: op iOS, macOS, tvOS en visionOS stuurt de runtime Core ML aan om de hele graph op de Neural Engine te houden. De browser en Node draaien hetzelfde model op WebAssembly en ONNX Runtime, langzamer dan Core ML, en er is geen native Android-build.

Voz weet niet welke van zijn 25 talen het hoort, en een taal die het niet dekt levert met stelligheid onzin op in plaats van een fout, dus combineer het met Ear. De nauwkeurigheid verschilt sterk per taal, woordeinden zijn de lastigere helft van de tijdstempels, en 467 MB is een echte download om tijdens de onboarding op te halen.

FAQ

Wat is Voz?

Transcribeer 10 minuten audio in 2s op een iPhone, 14x sneller dan Whisper, met precieze woordtijdstempels.

Draait Voz op het apparaat?

Ja. Voz draait op het apparaat, zonder serveraanroep, dus de data blijft bij de gebruiker.

Welke platforms ondersteunt Voz?

Voz wordt geleverd als een native on-device SDK voor Swift, JavaScript / TypeScript.

Hoeveel kost Voz?

Elk model is gratis voor maximaal 100k maandelijks actieve apparaten. Inference is onbeperkt. Neem contact op voor aangepaste licenties.

Hoe nauwkeurig of snel is Voz?

10 minuten voordracht in 2s op een iPhone 17 Pro, 1,2s op een iPhone 18 Pro en 2,1s op een iPhone 15 Pro. Op een M3 Ultra 14x sneller dan whisper.cpp large-v3-turbo op dezelfde podcast van 10 minuten, met een woordfoutpercentage van 7,40% op zes publieke Engelse sets waar Whisper 7,00% scoort.

Draait Voz buiten Apple-platforms?

Ja, in de browser en in Node. Het JavaScript-pakket draait hetzelfde model op WebAssembly en ONNX Runtime, dus een webapp of een server transcribeert zonder Apple-hardware, ook op Windows, Linux of in een Android-browser. Op Apple silicon draait het hele model op de Neural Engine, en daar is het het snelst. Een native Android-build is nog niet klaar.

Bronnen