Voz
Transkribera 10 minuter ljud på 2 s på en iPhone, 14x snabbare än Whisper, exakta ordtidsstämplar.

Transkribera 10 minuter på 2 sekunder.
Transkribera en ljud- eller videofil med Voz och få exakta start- och sluttider för varje ord. 10 minuter tar 2 s på en iPhone, på enheten, så inget laddas upp och inget faktureras per minut.
På Apple-kisel körs modellen på Neural Engine, så transkriberingen är blixtsnabb och drar mindre ström. På en Mac körs en backkatalog av poddar, intervjuer och föreläsningar igenom i en enda genomgång, och inget laddas upp.
Tidsstämplarna är precisa nog att redigera på. Ordstarter landar inom 83 ms från en forced aligner och ordslut inom 95 ms, för precis transkriptbaserad redigering. Voz är en version av NVIDIA:s Parakeet TDT 0.6B v3 optimerad för Apple Neural Engine, med noggrannhet jämförbar med Whisper large-v3-turbo på de flesta ljud, med en nedladdningsstorlek på bara 467 MB.
14x snabbare än Whisper.
10 minuter berättarröst på 2 s på en iPhone 17 Pro, 1,2 s på en iPhone 18 Pro och 2,1 s på en iPhone 15 Pro. På en M3 Ultra, 14x snabbare än whisper.cpp large-v3-turbo på samma 10-minuters poddljud, med en ordfelfrekvens på 7,40% på sex offentliga engelska uppsättningar där Whisper får 7,00%.
Tid att transkribera 10 minuter ljud.
| Enhet | Tid | Realtidsfaktor |
|---|---|---|
| M3 Ultra | 0,8s | 762x |
| iPhone 18 Pro | 1,2s | 492x |
| M4 Max | 1,3s | 453x |
| iPhone 17 Pro | 1,8s | 334x |
| iPhone 15 Pro | 2,1s | 283x |
| M1 Mac mini | 2,4s | 251x |
Ordfelfrekvens på datauppsättningarna från Open ASR Leaderboard, Voz med sin egen textnormaliserare, Whispers siffror från topplistan
| Datauppsättning | Voz | Whisper large-v3-turbo |
|---|---|---|
| LibriSpeech test-clean | 2,19% | 2,13% |
| LibriSpeech test-other | 3,86% | 3,70% |
| GigaSpeech | 9,70% | 8,47% |
| SPGISpeech | 3,86% | 2,79% |
| Earnings-22 | 12,97% | 11,07% |
| AMI | 11,84% | 13,87% |
| Average | 7,40% | 7,00% |
Läs raden som matchar ditt ljud. Rent, tätt inmikat tal hamnar runt 2–4% (LibriSpeech, SPGISpeech), poddar och webbvideo runt 10% (GigaSpeech), och mötesrum och telefonsamtal 12–13% (AMI, Earnings-22), vilket är där modellen slår Whisper. Siffror per språk på 10 minuter uppläst tal vardera finns på modellkortet, från 3,31% för italienska till 39,46% för grekiska. iPhone-tiderna och jämförelsen med whisper.cpp är våra egna körningar och finns inte på kortet ännu.
Användningsfall
Transkribera 10 minuter på 2 sekunder.
Transkribera vilken ljud- eller videofil som helst
Spela in en podd eller en video och hela transkriptet är klart innan exporten är färdig. Sökbar text med en tidsstämpel på varje ord, på vilket som helst av 25 språk, utan att lämna enheten.
Mala igenom en eftersläpning
Ett arkiv av intervjuer, föreläsningar eller mötesinspelningar blir sökbart i en enda genomgång på en Mac. Hundra timmar körs igenom på 20 minuter, och inget laddas upp.
Klipp på ett ord
Varje ord bär en start och ett slut, så ett markerat intervall i transkriptet är ett klipp i en videoredigerare. Kombinera den med Clips för shorts och Title för att namnge dem.
Inspiration
Idéer att bygga med Voz. Kopiera en prompt till din kodningsagent och kör.
Build a podcast player that transcribes every episode and makes it searchable, on the device.
Build a meeting recorder that hands you a timestamped transcript before you leave the room.
Turn voice memos into searchable, editable text notes, offline.
Generate SRT subtitles for any video file on the Mac.
Add captions to a video player that run on the device.
Build an interview app for journalists where sources never leave the phone.
Build a full podcast studio: transcribe, clip, and title on the device.
Record, clean, transcribe, and clip: a whole creator pipeline, offline.
Vad modellen gör
- Ordstarter inom 83 ms och ordslut inom 95 ms från en forced aligner, i genomsnitt, vid 80 ms ramupplösning.
- 10 minuter ljud på 2 s på en iPhone 17 Pro, 1,2 s på en iPhone 18 Pro och 2,1 s på en iPhone 15 Pro. På en M3 Ultra, 0,8 s vid 762x realtid. Enskilda korta klipp körs 50–62x, eftersom varje klipp betalar för ett helt 15 s-fönster.
- 7,40% ordfelfrekvens i genomsnitt över sex uppsättningar från Open ASR Leaderboard (Whisper large-v3-turbo: 7,00%), 2,83% på en halvtimmes berättarröst (Whisper: 2,72%), 11,84% på AMI-möten (Whisper: 13,87%).
- Hela grafen körs på Neural Engine utan CPU- eller GPU-reserv; toppminnet växer inte med inspelningens längd.
- 25 språk: bulgariska, kroatiska, tjeckiska, danska, nederländska, engelska, estniska, finska, franska, tyska, grekiska, ungerska, italienska, lettiska, litauiska, maltesiska, polska, portugisiska, rumänska, ryska, slovakiska, slovenska, spanska, svenska och ukrainska.
- 467 MB på disk, nedladdad vid behov och cachad; den första laddningen efter en nedladdning tar 20 s en gång medan Core ML specialiserar, sedan 0,2 s. Ladda ned under onboarding.
- Monoljud i valfri samplingsfrekvens; SDK:n omsamplar och nedmixar. Längre ljud klipps i 15 s-fönster vid pauser och fogas samman på de ord som angränsande fönster är överens om.
- Byggd på NVIDIA:s Parakeet TDT 0.6B v3, släppt under CC BY 4.0. Vikterna är oförändrade; konverteringen, kompressionen och Neural Engine-runtimen är våra.
Exempelapp
Clipper
Byggd med Voz, Clips, Title
Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.
Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.
macOS 26 or later, Apple Silicon
brew tap desert-ant-labs/tap
brew install --cask clipper
Kom igång
Lägg till taligenkänning i din iOS or macOS or web-app med några rader kod. Voz-dokumentation.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
import Voz
let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text // the transcript
result.words.first?.start // 80ms resolution
result.realtimeFactor // seconds of audio per second of wall clock
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS). What it does: Tal till text på enheten på Neural Engine. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0") // target dependency .product(name: "Voz", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/voz/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/voz onnxruntime-web
import { Voz } from "@desert-ant-labs/voz";
const voz = await Voz.load();
const result = await voz.transcribe(file); // File, Blob, ArrayBuffer, or samples
result.text;
result.words[0]; // { text, start, end }
result.realtimeFactor;
Add Voz from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: Tal till text på enheten på Neural Engine. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/voz onnxruntime-web Reference: - Model page: https://desertant.com/models/voz/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Specifikationer
- Hastighet
- 10 minuter ljud på 0,8–2,4 s på Mac och iPhone, 251–762x realtid; tider per enhet under Prestanda
- Noggrannhet
- 7,40% WER över sex uppsättningar från Open ASR Leaderboard; 2,83% långform; ordstarter 83 ms, ordslut 95 ms genomsnittligt fel
- Storlek på enheten
- 467 MB kompilerad Core ML, nedladdad vid behov
- Språk
- 25 europeiska språk; noggrannhet från 3,31% (italienska) till 39,46% (grekiska) på uppläst tal
- Modell
- NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), konverterad till Core ML och komprimerad av Desert Ant Labs: log-mel-frontend, conformer-encoder, transducer-decoder, allt på Neural Engine
- Plattformar
- iOS, iPadOS, macOS, tvOS, visionOS (Core ML); webbläsare och Node (WebAssembly, ONNX Runtime)
Hastigheten på Neural Engine gäller bara Apple: på iOS, macOS, tvOS och visionOS driver runtimen Core ML för att hålla hela grafen på Neural Engine. Webbläsaren och Node kör samma modell på WebAssembly och ONNX Runtime, långsammare än Core ML, och det finns inget nativt Android-bygge.
Voz vet inte vilket av sina 25 språk den hör, och ett språk den inte täcker ger självsäkert nonsens snarare än ett fel, så kombinera den med Ear. Noggrannheten varierar kraftigt mellan språk, ordslut är den svårare halvan av tidsstämplarna, och 467 MB är en verklig nedladdning att hämta under onboarding.
Vanliga frågor
Vad är Voz?
Transkribera 10 minuter ljud på 2 s på en iPhone, 14x snabbare än Whisper, exakta ordtidsstämplar.
Körs Voz lokalt på enheten?
Ja. Voz körs på enheten, utan något serveranrop, så att data stannar hos användaren.
Vilka plattformar stöder Voz?
Voz levereras som en nativ SDK på enheten för Swift, JavaScript / TypeScript.
Vad kostar Voz?
Varje modell är gratis upp till 100k månadsaktiva enheter. Inferensen är obegränsad. Kontakta oss för anpassade licenser.
Hur träffsäker eller snabb är Voz?
10 minuter berättarröst på 2 s på en iPhone 17 Pro, 1,2 s på en iPhone 18 Pro och 2,1 s på en iPhone 15 Pro. På en M3 Ultra, 14x snabbare än whisper.cpp large-v3-turbo på samma 10-minuters poddljud, med en ordfelfrekvens på 7,40% på sex offentliga engelska uppsättningar där Whisper får 7,00%.
Körs Voz utanför Apples plattformar?
Ja, i webbläsaren och i Node. JavaScript-paketet kör samma modell på WebAssembly och ONNX Runtime, så en webbapp eller en server transkriberar utan Apple-hårdvara, på Windows, Linux eller i en Android-webbläsare. På Apple-kisel körs hela modellen på Neural Engine, vilket är där den är snabbast. Ett nativt Android-bygge är inte klart ännu.