Voz
Transcrivez 10 minutes d'audio en 2 s sur un iPhone, 14x plus rapide que Whisper, avec des horodatages de mots précis.

Transcrivez 10 minutes en 2 secondes.
Transcrivez un fichier audio ou vidéo avec Voz et obtenez des temps de début et de fin précis pour chaque mot. 10 minutes prennent 2 s sur un iPhone, sur l'appareil, si bien que rien n'est envoyé et rien n'est facturé à la minute.
Sur Apple silicon, le modèle tourne sur le Neural Engine, si bien que la transcription est ultra-rapide et consomme moins d'énergie. Sur un Mac, un catalogue existant de podcasts, d'entretiens et de cours passe en une seule fois, et rien n'est envoyé.
Les horodatages sont assez précis pour monter dessus. Les débuts de mots tombent à 83 ms d'un aligneur forcé et les fins à 95 ms, pour un montage précis fondé sur la transcription. Voz est une version optimisée pour l'Apple Neural Engine du Parakeet TDT 0.6B v3 de NVIDIA, d'une exactitude comparable à Whisper large-v3-turbo sur la plupart des audios, avec une taille de téléchargement de seulement 467 MB.
14x plus rapide que Whisper.
10 minutes de narration en 2 s sur un iPhone 17 Pro, 1,2 s sur un iPhone 18 Pro et 2,1 s sur un iPhone 15 Pro. Sur un M3 Ultra, 14x plus rapide que whisper.cpp large-v3-turbo sur le même podcast de 10 minutes, avec un taux d'erreur sur les mots de 7,40 % sur six jeux anglais publics où Whisper obtient 7,00 %.
Temps de transcription de 10 minutes d'audio.
| Appareil | Temps | Temps réel |
|---|---|---|
| M3 Ultra | 0,8 s | 762x |
| iPhone 18 Pro | 1,2 s | 492x |
| M4 Max | 1,3 s | 453x |
| iPhone 17 Pro | 1,8 s | 334x |
| iPhone 15 Pro | 2,1 s | 283x |
| M1 Mac mini | 2,4 s | 251x |
Taux d'erreur sur les mots sur les jeux de l'Open ASR Leaderboard, Voz avec son propre normaliseur de texte, chiffres de Whisper issus du leaderboard
| Jeu de données | Voz | Whisper large-v3-turbo |
|---|---|---|
| LibriSpeech test-clean | 2,19 % | 2,13 % |
| LibriSpeech test-other | 3,86 % | 3,70 % |
| GigaSpeech | 9,70 % | 8,47 % |
| SPGISpeech | 3,86 % | 2,79 % |
| Earnings-22 | 12,97 % | 11,07 % |
| AMI | 11,84 % | 13,87 % |
| Average | 7,40 % | 7,00 % |
Lisez la ligne qui correspond à votre audio. Une parole propre, captée au plus près du micro, tombe autour de 2-4 % (LibriSpeech, SPGISpeech), les podcasts et la vidéo web autour de 10 % (GigaSpeech), et les salles de réunion et les appels téléphoniques à 12-13 % (AMI, Earnings-22), là où le modèle bat Whisper. Les chiffres par langue sur 10 minutes de parole lue chacun sont sur la fiche du modèle, de 3,31 % pour l'italien à 39,46 % pour le grec. Les temps sur iPhone et la comparaison whisper.cpp sont nos propres runs et ne sont pas encore sur la fiche.
Cas d'usage
Transcrivez 10 minutes en 2 secondes.
Transcrire n'importe quel fichier audio ou vidéo
Enregistrez un podcast ou une vidéo et la transcription complète est prête avant la fin de l'export. Un texte cherchable avec un horodatage sur chaque mot, dans l'une des 25 langues, sans quitter l'appareil.
Enchaîner un arriéré
Une archive d'entretiens, de cours ou d'enregistrements de réunions devient cherchable en une seule passe sur un Mac. Cent heures passent en 20 minutes, et rien n'est envoyé.
Couper sur un mot
Chaque mot porte un début et une fin, si bien qu'une plage sélectionnée dans la transcription est une coupe dans un éditeur vidéo. Associez-le à Clips pour les shorts et à Title pour les nommer.
Inspiration
Des idées à construire avec Voz. Copiez un prompt dans votre agent de code et lancez-vous.
Build a podcast player that transcribes every episode and makes it searchable, on the device.
Build a meeting recorder that hands you a timestamped transcript before you leave the room.
Turn voice memos into searchable, editable text notes, offline.
Generate SRT subtitles for any video file on the Mac.
Add captions to a video player that run on the device.
Build an interview app for journalists where sources never leave the phone.
Build a full podcast studio: transcribe, clip, and title on the device.
Record, clean, transcribe, and clip: a whole creator pipeline, offline.
Ce que fait le modèle
- Débuts de mots à 83 ms et fins de mots à 95 ms d'un aligneur forcé, en moyenne, à une résolution d'image de 80 ms.
- 10 minutes d'audio en 2 s sur un iPhone 17 Pro, 1,2 s sur un iPhone 18 Pro et 2,1 s sur un iPhone 15 Pro. Sur un M3 Ultra, 0,8 s à 762x en temps réel. Les clips courts isolés tournent à 50-62x, parce que chaque clip paie une fenêtre complète de 15 s.
- 7,40 % de taux d'erreur sur les mots en moyenne sur six jeux de l'Open ASR Leaderboard (Whisper large-v3-turbo : 7,00 %), 2,83 % sur une demi-heure de narration (Whisper : 2,72 %), 11,84 % sur les réunions AMI (Whisper : 13,87 %).
- Tout le graphe tourne sur le Neural Engine sans repli CPU ou GPU ; la mémoire de pointe ne croît pas avec la durée de l'enregistrement.
- 25 langues : bulgare, croate, tchèque, danois, néerlandais, anglais, estonien, finnois, français, allemand, grec, hongrois, italien, letton, lituanien, maltais, polonais, portugais, roumain, russe, slovaque, slovène, espagnol, suédois et ukrainien.
- 467 MB sur le disque, téléchargé à la demande et mis en cache ; le premier chargement après un téléchargement prend 20 s une fois pendant que Core ML se spécialise, puis 0,2 s. Téléchargez pendant l'onboarding.
- Audio mono à n'importe quelle fréquence d'échantillonnage ; le SDK rééchantillonne et remixe. L'audio plus long est découpé en fenêtres de 15 s aux pauses et raccordé sur les mots que les fenêtres voisines confirment.
- Bâti sur le Parakeet TDT 0.6B v3 de NVIDIA, publié sous CC BY 4.0. Les poids sont inchangés ; la conversion, la compression et le runtime Neural Engine sont les nôtres.
Application d’exemple
Clipper
Conçu avec Voz, Clips, Title
Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.
Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.
macOS 26 or later, Apple Silicon
brew tap desert-ant-labs/tap
brew install --cask clipper
Prise en main
Ajoutez reconnaissance vocale à votre application iOS or macOS or web en quelques lignes de code. Docs Voz.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
import Voz
let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text // the transcript
result.words.first?.start // 80ms resolution
result.realtimeFactor // seconds of audio per second of wall clock
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS). What it does: Voz : reconnaissance vocale sur l'appareil, sur le Neural Engine. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0") // target dependency .product(name: "Voz", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/voz/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/voz onnxruntime-web
import { Voz } from "@desert-ant-labs/voz";
const voz = await Voz.load();
const result = await voz.transcribe(file); // File, Blob, ArrayBuffer, or samples
result.text;
result.words[0]; // { text, start, end }
result.realtimeFactor;
Add Voz from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: Voz : reconnaissance vocale sur l'appareil, sur le Neural Engine. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/voz onnxruntime-web Reference: - Model page: https://desertant.com/models/voz/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Spécifications
- Vitesse
- 10 minutes d'audio en 0,8 s à 2,4 s sur Mac et iPhone, 251x à 762x en temps réel ; temps par appareil dans Performances
- Exactitude
- 7,40 % de WER sur six jeux de l'Open ASR Leaderboard ; 2,83 % en forme longue ; débuts de mots à 83 ms, fins à 95 ms d'erreur moyenne
- Taille sur l'appareil
- 467 MB de Core ML compilé, téléchargé à la demande
- Langues
- 25 langues européennes ; exactitude de 3,31 % (italien) à 39,46 % (grec) sur de la parole lue
- Modèle
- NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), converti en Core ML et compressé par Desert Ant Labs : frontend log-mel, encodeur conformer, décodeur transducer, tout sur le Neural Engine
- Plateformes
- iOS, iPadOS, macOS, tvOS, visionOS (Core ML) ; navigateur et Node (WebAssembly, ONNX Runtime)
La vitesse du Neural Engine est réservée à Apple : sur iOS, macOS, tvOS et visionOS, le runtime pilote Core ML pour garder tout le graphe sur le Neural Engine. Le navigateur et Node exécutent le même modèle sur WebAssembly et ONNX Runtime, plus lentement que Core ML, et il n'existe pas de version Android native.
Voz ne sait pas laquelle de ses 25 langues il entend, et une langue qu'il ne couvre pas produit des absurdités confiantes plutôt qu'une erreur : associez-le donc à Ear. L'exactitude varie fortement selon la langue, les fins de mots sont la moitié la plus difficile des horodatages, et 467 MB est un vrai téléchargement à récupérer pendant l'onboarding.
FAQ
Qu'est-ce que Voz ?
Transcrivez 10 minutes d'audio en 2 s sur un iPhone, 14x plus rapide que Whisper, avec des horodatages de mots précis.
Voz fonctionne-t-il sur l'appareil ?
Oui. Voz s'exécute sur l'appareil, sans appel serveur : les données restent chez l'utilisateur.
Quelles plateformes Voz prend-il en charge ?
Voz est livré sous forme de SDK natif sur l'appareil pour Swift, JavaScript / TypeScript.
Combien coûte Voz ?
Chaque modèle est gratuit jusqu'à 100k appareils actifs mensuels. L'inférence est illimitée. Contactez-nous pour des licences sur mesure.
Quelle est la précision ou la vitesse de Voz ?
10 minutes de narration en 2 s sur un iPhone 17 Pro, 1,2 s sur un iPhone 18 Pro et 2,1 s sur un iPhone 15 Pro. Sur un M3 Ultra, 14x plus rapide que whisper.cpp large-v3-turbo sur le même podcast de 10 minutes, avec un taux d'erreur sur les mots de 7,40 % sur six jeux anglais publics où Whisper obtient 7,00 %.
Voz fonctionne-t-il en dehors des plateformes Apple ?
Oui, dans le navigateur et dans Node. Le paquet JavaScript exécute le même modèle sur WebAssembly et ONNX Runtime : une application web ou un serveur transcrit donc sans matériel Apple, y compris sur Windows, Linux ou dans un navigateur Android. Sur Apple silicon, le modèle entier tourne sur le Neural Engine, là où il est le plus rapide. Une version Android native n'est pas encore prête.