Desert Ant Labs

Voz

Reconnaissance vocaleDisponible

Transcrivez 10 minutes d'audio en 2 s sur un iPhone, 14x plus rapide que Whisper, avec des horodatages de mots précis.

Transcrivez 10 minutes en 2 secondes.

Transcrivez un fichier audio ou vidéo avec Voz et obtenez des temps de début et de fin précis pour chaque mot. 10 minutes prennent 2 s sur un iPhone, sur l'appareil, si bien que rien n'est envoyé et rien n'est facturé à la minute.

Sur Apple silicon, le modèle tourne sur le Neural Engine, si bien que la transcription est ultra-rapide et consomme moins d'énergie. Sur un Mac, un catalogue existant de podcasts, d'entretiens et de cours passe en une seule fois, et rien n'est envoyé.

Les horodatages sont assez précis pour monter dessus. Les débuts de mots tombent à 83 ms d'un aligneur forcé et les fins à 95 ms, pour un montage précis fondé sur la transcription. Voz est une version optimisée pour l'Apple Neural Engine du Parakeet TDT 0.6B v3 de NVIDIA, d'une exactitude comparable à Whisper large-v3-turbo sur la plupart des audios, avec une taille de téléchargement de seulement 467 MB.

14x plus rapide que Whisper.

10 minutes de narration en 2 s sur un iPhone 17 Pro, 1,2 s sur un iPhone 18 Pro et 2,1 s sur un iPhone 15 Pro. Sur un M3 Ultra, 14x plus rapide que whisper.cpp large-v3-turbo sur le même podcast de 10 minutes, avec un taux d'erreur sur les mots de 7,40 % sur six jeux anglais publics où Whisper obtient 7,00 %.

0.0s
0:00 / 10:00

Audio : Ant Ventures, un enregistrement LibriVox, domaine public.

2 s
10 minutes d'audio
iPhone 17 Pro, sur le Neural Engine
14x
Plus rapide que Whisper
large-v3-turbo via whisper.cpp, 10 min, M3 Ultra
7,40 %
Taux d'erreur sur les mots
six jeux de l'Open ASR Leaderboard ; Whisper large-v3-turbo 7,00 %
467 MB
Sur le disque
Whisper large-v3-turbo : 1,6 GB en fp16

Temps de transcription de 10 minutes d'audio.

AppareilTempsTemps réel
M3 Ultra0,8 s762x
iPhone 18 Pro1,2 s492x
M4 Max1,3 s453x
iPhone 17 Pro1,8 s334x
iPhone 15 Pro2,1 s283x
M1 Mac mini2,4 s251x

Taux d'erreur sur les mots sur les jeux de l'Open ASR Leaderboard, Voz avec son propre normaliseur de texte, chiffres de Whisper issus du leaderboard

Jeu de donnéesVozWhisper large-v3-turbo
LibriSpeech test-clean2,19 %2,13 %
LibriSpeech test-other3,86 %3,70 %
GigaSpeech9,70 %8,47 %
SPGISpeech3,86 %2,79 %
Earnings-2212,97 %11,07 %
AMI11,84 %13,87 %
Average7,40 %7,00 %

Lisez la ligne qui correspond à votre audio. Une parole propre, captée au plus près du micro, tombe autour de 2-4 % (LibriSpeech, SPGISpeech), les podcasts et la vidéo web autour de 10 % (GigaSpeech), et les salles de réunion et les appels téléphoniques à 12-13 % (AMI, Earnings-22), là où le modèle bat Whisper. Les chiffres par langue sur 10 minutes de parole lue chacun sont sur la fiche du modèle, de 3,31 % pour l'italien à 39,46 % pour le grec. Les temps sur iPhone et la comparaison whisper.cpp sont nos propres runs et ne sont pas encore sur la fiche.

Cas d'usage

Transcrivez 10 minutes en 2 secondes.

Transcrire n'importe quel fichier audio ou vidéo

Enregistrez un podcast ou une vidéo et la transcription complète est prête avant la fin de l'export. Un texte cherchable avec un horodatage sur chaque mot, dans l'une des 25 langues, sans quitter l'appareil.

Enchaîner un arriéré

Une archive d'entretiens, de cours ou d'enregistrements de réunions devient cherchable en une seule passe sur un Mac. Cent heures passent en 20 minutes, et rien n'est envoyé.

Couper sur un mot

Chaque mot porte un début et une fin, si bien qu'une plage sélectionnée dans la transcription est une coupe dans un éditeur vidéo. Associez-le à Clips pour les shorts et à Title pour les nommer.

Inspiration

Des idées à construire avec Voz. Copiez un prompt dans votre agent de code et lancez-vous.

Voz

Build a podcast player that transcribes every episode and makes it searchable, on the device.

Copier le prompt
Voz

Build a meeting recorder that hands you a timestamped transcript before you leave the room.

Copier le prompt
Voz

Turn voice memos into searchable, editable text notes, offline.

Copier le prompt
Voz

Generate SRT subtitles for any video file on the Mac.

Copier le prompt
Voz

Add captions to a video player that run on the device.

Copier le prompt
Voz

Build an interview app for journalists where sources never leave the phone.

Copier le prompt
VozClipsTitle

Build a full podcast studio: transcribe, clip, and title on the device.

Copier le prompt
ClearVozClips

Record, clean, transcribe, and clip: a whole creator pipeline, offline.

Copier le prompt
Voir les 26 idées

Ce que fait le modèle

  • Débuts de mots à 83 ms et fins de mots à 95 ms d'un aligneur forcé, en moyenne, à une résolution d'image de 80 ms.
  • 10 minutes d'audio en 2 s sur un iPhone 17 Pro, 1,2 s sur un iPhone 18 Pro et 2,1 s sur un iPhone 15 Pro. Sur un M3 Ultra, 0,8 s à 762x en temps réel. Les clips courts isolés tournent à 50-62x, parce que chaque clip paie une fenêtre complète de 15 s.
  • 7,40 % de taux d'erreur sur les mots en moyenne sur six jeux de l'Open ASR Leaderboard (Whisper large-v3-turbo : 7,00 %), 2,83 % sur une demi-heure de narration (Whisper : 2,72 %), 11,84 % sur les réunions AMI (Whisper : 13,87 %).
  • Tout le graphe tourne sur le Neural Engine sans repli CPU ou GPU ; la mémoire de pointe ne croît pas avec la durée de l'enregistrement.
  • 25 langues : bulgare, croate, tchèque, danois, néerlandais, anglais, estonien, finnois, français, allemand, grec, hongrois, italien, letton, lituanien, maltais, polonais, portugais, roumain, russe, slovaque, slovène, espagnol, suédois et ukrainien.
  • 467 MB sur le disque, téléchargé à la demande et mis en cache ; le premier chargement après un téléchargement prend 20 s une fois pendant que Core ML se spécialise, puis 0,2 s. Téléchargez pendant l'onboarding.
  • Audio mono à n'importe quelle fréquence d'échantillonnage ; le SDK rééchantillonne et remixe. L'audio plus long est découpé en fenêtres de 15 s aux pauses et raccordé sur les mots que les fenêtres voisines confirment.
  • Bâti sur le Parakeet TDT 0.6B v3 de NVIDIA, publié sous CC BY 4.0. Les poids sont inchangés ; la conversion, la compression et le runtime Neural Engine sont les nôtres.

Application d’exemple

Clipper

Conçu avec Voz, Clips, Title

Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.

Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.

macOS 26 or later, Apple Silicon

Installer avec Homebrew
brew tap desert-ant-labs/tap
brew install --cask clipper

Prise en main

Ajoutez reconnaissance vocale à votre application iOS or macOS or web en quelques lignes de code. Docs Voz.

iOS, macOS
Installation
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
Exemple - Swift
import Voz

let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text                     // the transcript
result.words.first?.start       // 80ms resolution
result.realtimeFactor           // seconds of audio per second of wall clock
Construire avec un prompt
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: Voz : reconnaissance vocale sur l'appareil, sur le Neural Engine.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/voz/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidBientôt disponible
Web, Node.js
Installation
npm i @desert-ant-labs/voz onnxruntime-web
Exemple - TypeScript
import { Voz } from "@desert-ant-labs/voz";

const voz = await Voz.load();
const result = await voz.transcribe(file);   // File, Blob, ArrayBuffer, or samples
result.text;
result.words[0];        // { text, start, end }
result.realtimeFactor;
Construire avec un prompt
Add Voz from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js).

What it does: Voz : reconnaissance vocale sur l'appareil, sur le Neural Engine.

SDK:

JavaScript / TypeScript (Web, Node.js)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
npm i @desert-ant-labs/voz onnxruntime-web

Reference:
- Model page: https://desertant.com/models/voz/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.

Spécifications

Vitesse
10 minutes d'audio en 0,8 s à 2,4 s sur Mac et iPhone, 251x à 762x en temps réel ; temps par appareil dans Performances
Exactitude
7,40 % de WER sur six jeux de l'Open ASR Leaderboard ; 2,83 % en forme longue ; débuts de mots à 83 ms, fins à 95 ms d'erreur moyenne
Taille sur l'appareil
467 MB de Core ML compilé, téléchargé à la demande
Langues
25 langues européennes ; exactitude de 3,31 % (italien) à 39,46 % (grec) sur de la parole lue
Modèle
NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), converti en Core ML et compressé par Desert Ant Labs : frontend log-mel, encodeur conformer, décodeur transducer, tout sur le Neural Engine
Plateformes
iOS, iPadOS, macOS, tvOS, visionOS (Core ML) ; navigateur et Node (WebAssembly, ONNX Runtime)

La vitesse du Neural Engine est réservée à Apple : sur iOS, macOS, tvOS et visionOS, le runtime pilote Core ML pour garder tout le graphe sur le Neural Engine. Le navigateur et Node exécutent le même modèle sur WebAssembly et ONNX Runtime, plus lentement que Core ML, et il n'existe pas de version Android native.

Voz ne sait pas laquelle de ses 25 langues il entend, et une langue qu'il ne couvre pas produit des absurdités confiantes plutôt qu'une erreur : associez-le donc à Ear. L'exactitude varie fortement selon la langue, les fins de mots sont la moitié la plus difficile des horodatages, et 467 MB est un vrai téléchargement à récupérer pendant l'onboarding.

FAQ

Qu'est-ce que Voz ?

Transcrivez 10 minutes d'audio en 2 s sur un iPhone, 14x plus rapide que Whisper, avec des horodatages de mots précis.

Voz fonctionne-t-il sur l'appareil ?

Oui. Voz s'exécute sur l'appareil, sans appel serveur : les données restent chez l'utilisateur.

Quelles plateformes Voz prend-il en charge ?

Voz est livré sous forme de SDK natif sur l'appareil pour Swift, JavaScript / TypeScript.

Combien coûte Voz ?

Chaque modèle est gratuit jusqu'à 100k appareils actifs mensuels. L'inférence est illimitée. Contactez-nous pour des licences sur mesure.

Quelle est la précision ou la vitesse de Voz ?

10 minutes de narration en 2 s sur un iPhone 17 Pro, 1,2 s sur un iPhone 18 Pro et 2,1 s sur un iPhone 15 Pro. Sur un M3 Ultra, 14x plus rapide que whisper.cpp large-v3-turbo sur le même podcast de 10 minutes, avec un taux d'erreur sur les mots de 7,40 % sur six jeux anglais publics où Whisper obtient 7,00 %.

Voz fonctionne-t-il en dehors des plateformes Apple ?

Oui, dans le navigateur et dans Node. Le paquet JavaScript exécute le même modèle sur WebAssembly et ONNX Runtime : une application web ou un serveur transcrit donc sans matériel Apple, y compris sur Windows, Linux ou dans un navigateur Android. Sur Apple silicon, le modèle entier tourne sur le Neural Engine, là où il est le plus rapide. Une version Android native n'est pas encore prête.

Ressources