Voz
Da voce a testo on-device: trascrive 10 minuti di audio in 2 s su un iPhone, 14x più veloce di Whisper, con timestamp per parola precisi.

Trascrive 10 minuti in 2 secondi.
Trascrivi un file audio o video con Voz e ottieni tempi di inizio e fine precisi per ogni parola. 10 minuti richiedono 2 s su un iPhone, sul dispositivo, quindi non viene caricato nulla e non si paga al minuto.
Su Apple silicon il modello gira sul Neural Engine, così la trascrizione è fulminea e consuma meno energia. Su un Mac un intero catalogo di podcast, interviste e lezioni scorre in un solo passaggio, e non viene caricato nulla.
I timestamp sono abbastanza precisi da montarci sopra. Gli inizi delle parole cadono entro 83 ms da un allineatore forzato e le fini entro 95 ms, per un montaggio preciso basato sulla trascrizione. Voz è una versione del Parakeet TDT 0.6B v3 di NVIDIA ottimizzata per l'Apple Neural Engine, con un'accuratezza paragonabile a Whisper large-v3-turbo sulla maggior parte dell'audio, e un download di soli 467 MB.
14x più veloce di Whisper.
10 minuti di narrazione in 2 s su un iPhone 17 Pro, 1,2 s su un iPhone 18 Pro e 2,1 s su un iPhone 15 Pro. Su un M3 Ultra, 14x più veloce di whisper.cpp large-v3-turbo sullo stesso podcast di 10 minuti, con un tasso di errore per parola del 7,40% su sei set pubblici in inglese dove Whisper ottiene 7,00%.
Tempo di trascrizione di 10 minuti di audio.
| Dispositivo | Tempo | Tempo reale |
|---|---|---|
| M3 Ultra | 0,8 s | 762x |
| iPhone 18 Pro | 1,2 s | 492x |
| M4 Max | 1,3 s | 453x |
| iPhone 17 Pro | 1,8 s | 334x |
| iPhone 15 Pro | 2,1 s | 283x |
| M1 Mac mini | 2,4 s | 251x |
Tasso di errore per parola sui dataset dell'Open ASR Leaderboard, Voz con il proprio normalizzatore di testo, le cifre di Whisper dalla leaderboard
| Dataset | Voz | Whisper large-v3-turbo |
|---|---|---|
| LibriSpeech test-clean | 2,19% | 2,13% |
| LibriSpeech test-other | 3,86% | 3,70% |
| GigaSpeech | 9,70% | 8,47% |
| SPGISpeech | 3,86% | 2,79% |
| Earnings-22 | 12,97% | 11,07% |
| AMI | 11,84% | 13,87% |
| Average | 7,40% | 7,00% |
Leggi la riga che corrisponde al tuo audio. Il parlato pulito e ravvicinato si attesta intorno al 2-4% (LibriSpeech, SPGISpeech), i podcast e i video web intorno al 10% (GigaSpeech), e le sale riunioni e le telefonate al 12-13% (AMI, Earnings-22), che è dove il modello batte Whisper. Le cifre per lingua, su 10 minuti di parlato letto ciascuna, sono sulla scheda del modello, dal 3,31% dell'italiano al 39,46% del greco. I tempi su iPhone e il confronto con whisper.cpp sono nostre misurazioni e non sono ancora sulla scheda.
Casi d'uso
Trascrive 10 minuti in 2 secondi.
Trascrivi qualsiasi file audio o video
Registra un podcast o un video e la trascrizione completa è pronta prima che l'esportazione finisca. Testo ricercabile con un timestamp su ogni parola, in una qualsiasi di 25 lingue, senza lasciare il dispositivo.
Macina un arretrato
Un archivio di interviste, lezioni o registrazioni di riunioni diventa ricercabile in un solo passaggio su un Mac. Cento ore scorrono in 20 minuti, e non viene caricato nulla.
Taglia su una parola
Ogni parola porta un inizio e una fine, così un intervallo selezionato nella trascrizione è un taglio in un editor video. Abbinalo a Clips per gli short e a Title per nominarli.
Ispirazione
Idee da costruire con Voz. Copia un prompt nel tuo coding agent e parti.
Build a podcast player that transcribes every episode and makes it searchable, on the device.
Build a meeting recorder that hands you a timestamped transcript before you leave the room.
Turn voice memos into searchable, editable text notes, offline.
Generate SRT subtitles for any video file on the Mac.
Add captions to a video player that run on the device.
Build an interview app for journalists where sources never leave the phone.
Build a full podcast studio: transcribe, clip, and title on the device.
Record, clean, transcribe, and clip: a whole creator pipeline, offline.
Cosa fa il modello
- Inizi delle parole entro 83 ms e fini entro 95 ms da un allineatore forzato, in media, con risoluzione di frame di 80 ms.
- 10 minuti di audio in 2 s su un iPhone 17 Pro, 1,2 s su un iPhone 18 Pro e 2,1 s su un iPhone 15 Pro. Su un M3 Ultra, 0,8 s a 762x rispetto al tempo reale. Le singole clip brevi vanno a 50-62x, perché ogni clip paga per una finestra piena di 15 s.
- Tasso di errore per parola del 7,40% mediato su sei set dell'Open ASR Leaderboard (Whisper large-v3-turbo: 7,00%), 2,83% su mezz'ora di narrazione (Whisper: 2,72%), 11,84% sulle riunioni AMI (Whisper: 13,87%).
- L'intero grafo gira sul Neural Engine senza fallback su CPU o GPU; la memoria di picco non cresce con la durata della registrazione.
- 25 lingue: bulgaro, croato, ceco, danese, olandese, inglese, estone, finlandese, francese, tedesco, greco, ungherese, italiano, lettone, lituano, maltese, polacco, portoghese, rumeno, russo, slovacco, sloveno, spagnolo, svedese e ucraino.
- 467 MB su disco, scaricati su richiesta e tenuti in cache; il primo caricamento dopo un download richiede 20 s una volta sola mentre Core ML si specializza, poi 0,2 s. Scaricalo durante l'onboarding.
- Audio mono a qualsiasi frequenza di campionamento; l'SDK ricampiona e fa il downmix. L'audio più lungo viene tagliato in finestre da 15 s nelle pause e ricucito sulle parole su cui le finestre vicine concordano.
- Costruito sul Parakeet TDT 0.6B v3 di NVIDIA, rilasciato sotto CC BY 4.0. I pesi sono invariati; la conversione, la compressione e il runtime per il Neural Engine sono nostri.
App di esempio
Clipper
Costruito con Voz, Clips, Title
Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.
Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.
macOS 26 or later, Apple Silicon
brew tap desert-ant-labs/tap
brew install --cask clipper
Per iniziare
Aggiungi riconoscimento vocale alla tua app iOS or macOS or web in poche righe di codice. Documentazione di Voz.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
import Voz
let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text // the transcript
result.words.first?.start // 80ms resolution
result.realtimeFactor // seconds of audio per second of wall clock
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS). What it does: da voce a testo on-device sul Neural Engine. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0") // target dependency .product(name: "Voz", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/voz/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/voz onnxruntime-web
import { Voz } from "@desert-ant-labs/voz";
const voz = await Voz.load();
const result = await voz.transcribe(file); // File, Blob, ArrayBuffer, or samples
result.text;
result.words[0]; // { text, start, end }
result.realtimeFactor;
Add Voz from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: da voce a testo on-device sul Neural Engine. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/voz onnxruntime-web Reference: - Model page: https://desertant.com/models/voz/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Specifiche
- Velocità
- 10 minuti di audio in 0,8 s a 2,4 s su Mac e iPhone, 251x a 762x rispetto al tempo reale; tempi per dispositivo in Prestazioni
- Accuratezza
- 7,40% di WER su sei set dell'Open ASR Leaderboard; 2,83% sul formato lungo; errore medio di 83 ms sugli inizi delle parole, 95 ms sulle fini
- Dimensione sul dispositivo
- 467 MB di Core ML compilato, scaricato su richiesta
- Lingue
- 25 lingue europee; accuratezza dal 3,31% (italiano) al 39,46% (greco) su parlato letto
- Modello
- NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), convertito in Core ML e compresso da Desert Ant Labs: frontend log-mel, encoder conformer, decoder transducer, tutto sul Neural Engine
- Piattaforme
- iOS, iPadOS, macOS, tvOS, visionOS (Core ML); browser e Node (WebAssembly, ONNX Runtime)
La velocità del Neural Engine è solo per Apple: su iOS, macOS, tvOS e visionOS il runtime pilota Core ML per tenere l'intero grafo sul Neural Engine. Il browser e Node eseguono lo stesso modello su WebAssembly e ONNX Runtime, più lentamente di Core ML, e non esiste una build nativa per Android.
Voz non sa quale delle sue 25 lingue sta sentendo, e una lingua che non copre produce sciocchezze sicure di sé invece di un errore, quindi abbinalo a Ear. L'accuratezza varia molto da lingua a lingua, la fine delle parole è la metà più difficile dei timestamp, e 467 MB sono un download consistente durante l'onboarding.
FAQ
Cos'è Voz?
Da voce a testo on-device: trascrive 10 minuti di audio in 2 s su un iPhone, 14x più veloce di Whisper, con timestamp per parola precisi.
Voz funziona sul dispositivo?
Sì. Voz funziona sul dispositivo, senza chiamate a un server, quindi i dati restano con l'utente.
Quali piattaforme supporta Voz?
Voz è distribuito come SDK nativo on-device per Swift, JavaScript / TypeScript.
Quanto costa Voz?
Ogni modello è gratuito fino a 100k dispositivi attivi mensili. L'inferenza è illimitata. Contattaci per licenze personalizzate.
Quanto è preciso o veloce Voz?
10 minuti di narrazione in 2 s su un iPhone 17 Pro, 1,2 s su un iPhone 18 Pro e 2,1 s su un iPhone 15 Pro. Su un M3 Ultra, 14x più veloce di whisper.cpp large-v3-turbo sullo stesso podcast di 10 minuti, con un tasso di errore per parola del 7,40% su sei set pubblici in inglese dove Whisper ottiene 7,00%.
Voz gira al di fuori delle piattaforme Apple?
Sì, nel browser e in Node. Il pacchetto JavaScript esegue lo stesso modello su WebAssembly e ONNX Runtime, così una web app o un server trascrive senza hardware Apple, anche su Windows, Linux o nel browser di un dispositivo Android. Su Apple silicon l'intero modello gira sul Neural Engine, dove è più veloce. Una build nativa per Android non è ancora pronta.