Voz
Transcribe 10 minutos de audio en 2 s en un iPhone, 14x más rápido que Whisper, con marcas de tiempo precisas por palabra.

Transcribe 10 minutos en 2 segundos.
Transcribe un archivo de audio o vídeo con Voz y obtén tiempos de inicio y fin precisos para cada palabra. 10 minutos tardan 2 s en un iPhone, en el dispositivo, así que no se sube nada y no se cobra por minuto.
En Apple silicon, el modelo se ejecuta en el Neural Engine, así que transcribir es ultrarrápido y consume menos energía. En un Mac, un catálogo antiguo de podcasts, entrevistas y clases se procesa de una sola pasada, y no se sube nada.
Las marcas de tiempo son lo bastante precisas para editar sobre ellas. Los inicios de palabra caen a menos de 83 ms de un alineador forzado y los finales a menos de 95 ms, para una edición precisa basada en la transcripción. Voz es una versión de Parakeet TDT 0.6B v3 de NVIDIA optimizada para el Apple Neural Engine, con una exactitud comparable a la de Whisper large-v3-turbo en la mayoría del audio, y un tamaño de descarga de solo 467 MB.
14x más rápido que Whisper.
10 minutos de narración en 2 s en un iPhone 17 Pro, 1,2 s en un iPhone 18 Pro y 2,1 s en un iPhone 15 Pro. En un M3 Ultra, 14x más rápido que whisper.cpp large-v3-turbo con el mismo podcast de 10 minutos, con una tasa de error de palabra del 7,40% en seis conjuntos públicos en inglés donde Whisper obtiene el 7,00%.
Tiempo de transcripción de 10 minutos de audio.
| Dispositivo | Tiempo | Tiempo real |
|---|---|---|
| M3 Ultra | 0,8 s | 762x |
| iPhone 18 Pro | 1,2 s | 492x |
| M4 Max | 1,3 s | 453x |
| iPhone 17 Pro | 1,8 s | 334x |
| iPhone 15 Pro | 2,1 s | 283x |
| M1 Mac mini | 2,4 s | 251x |
Tasa de error de palabra en los conjuntos del Open ASR Leaderboard, Voz con su propio normalizador de texto, las cifras de Whisper tomadas del leaderboard
| Conjunto de datos | Voz | Whisper large-v3-turbo |
|---|---|---|
| LibriSpeech test-clean | 2,19% | 2,13% |
| LibriSpeech test-other | 3,86% | 3,70% |
| GigaSpeech | 9,70% | 8,47% |
| SPGISpeech | 3,86% | 2,79% |
| Earnings-22 | 12,97% | 11,07% |
| AMI | 11,84% | 13,87% |
| Average | 7,40% | 7,00% |
Lee la fila que coincide con tu audio. El habla limpia y con micrófono cercano ronda el 2-4% (LibriSpeech, SPGISpeech), los podcasts y el vídeo web en torno al 10% (GigaSpeech), y las salas de reuniones y las llamadas telefónicas el 12-13% (AMI, Earnings-22), que es donde el modelo supera a Whisper. Las cifras por idioma sobre 10 minutos de habla leída cada una están en la ficha del modelo, del 3,31% del italiano al 39,46% del griego. Los tiempos en iPhone y la comparación con whisper.cpp son ejecuciones propias y aún no están en la ficha.
Casos de uso
Transcribe 10 minutos en 2 segundos.
Transcribe cualquier archivo de audio o vídeo
Graba un podcast o un vídeo y la transcripción completa está lista antes de que termine la exportación. Texto en el que puedes buscar con una marca de tiempo en cada palabra, en cualquiera de los 25 idiomas, sin salir del dispositivo.
Despacha el trabajo acumulado
Una biblioteca de entrevistas, clases o grabaciones de reuniones se vuelve consultable de una sola pasada en un Mac. Cien horas se procesan en 20 minutos, y no se sube nada.
Corta en una palabra
Cada palabra lleva un inicio y un fin, así que un rango seleccionado en la transcripción es un corte en un editor de vídeo. Combínalo con Clips para los shorts y con Title para nombrarlos.
Inspiración
Ideas para crear con Voz. Copia un prompt en tu agente de código y adelante.
Build a podcast player that transcribes every episode and makes it searchable, on the device.
Build a meeting recorder that hands you a timestamped transcript before you leave the room.
Turn voice memos into searchable, editable text notes, offline.
Generate SRT subtitles for any video file on the Mac.
Add captions to a video player that run on the device.
Build an interview app for journalists where sources never leave the phone.
Build a full podcast studio: transcribe, clip, and title on the device.
Record, clean, transcribe, and clip: a whole creator pipeline, offline.
Qué hace el modelo
- Los inicios de palabra caen a menos de 83 ms y los finales a menos de 95 ms de un alineador forzado, de media, con una resolución de trama de 80 ms.
- 10 minutos de audio en 2 s en un iPhone 17 Pro, 1,2 s en un iPhone 18 Pro y 2,1 s en un iPhone 15 Pro. En un M3 Ultra, 0,8 s a 762x en tiempo real. Los clips cortos sueltos van a 50-62x, porque cada clip paga una ventana completa de 15 s.
- Tasa de error de palabra del 7,40% de media en seis conjuntos del Open ASR Leaderboard (Whisper large-v3-turbo: 7,00%), 2,83% en media hora de narración (Whisper: 2,72%), 11,84% en las reuniones de AMI (Whisper: 13,87%).
- Todo el grafo se ejecuta en el Neural Engine sin recurrir a la CPU ni a la GPU; la memoria máxima no crece con la duración de la grabación.
- 25 idiomas: búlgaro, croata, checo, danés, neerlandés, inglés, estonio, finés, francés, alemán, griego, húngaro, italiano, letón, lituano, maltés, polaco, portugués, rumano, ruso, eslovaco, esloveno, español, sueco y ucraniano.
- 467 MB en disco, descargado bajo demanda y guardado en caché; la primera carga tras la descarga tarda 20 s una vez mientras Core ML se especializa, y luego 0,2 s. Descárgalo durante la incorporación.
- Audio mono a cualquier frecuencia de muestreo; el SDK remuestrea y mezcla a mono. El audio más largo se divide en ventanas de 15 s en las pausas y se une por las palabras en las que coinciden las ventanas contiguas.
- Construido sobre Parakeet TDT 0.6B v3 de NVIDIA, publicado bajo CC BY 4.0. Los pesos no se modifican; la conversión, la compresión y el runtime para el Neural Engine son nuestros.
Aplicación de ejemplo
Clipper
Creado con Voz, Clips, Title
Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.
Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.
macOS 26 or later, Apple Silicon
brew tap desert-ant-labs/tap
brew install --cask clipper
Primeros pasos
Añade reconocimiento de voz a tu app de iOS or macOS or web con unas pocas líneas de código. Docs de Voz.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
import Voz
let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text // the transcript
result.words.first?.start // 80ms resolution
result.realtimeFactor // seconds of audio per second of wall clock
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS). What it does: voz a texto en el dispositivo en el Neural Engine. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0") // target dependency .product(name: "Voz", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/voz/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/voz onnxruntime-web
import { Voz } from "@desert-ant-labs/voz";
const voz = await Voz.load();
const result = await voz.transcribe(file); // File, Blob, ArrayBuffer, or samples
result.text;
result.words[0]; // { text, start, end }
result.realtimeFactor;
Add Voz from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: voz a texto en el dispositivo en el Neural Engine. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/voz onnxruntime-web Reference: - Model page: https://desertant.com/models/voz/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificaciones
- Velocidad
- 10 minutos de audio en 0,8 s a 2,4 s en Mac y iPhone, 251x a 762x en tiempo real; tiempos por dispositivo en Rendimiento
- Exactitud
- 7,40% de WER en seis conjuntos del Open ASR Leaderboard; 2,83% en formato largo; error medio de 83 ms en los inicios de palabra y 95 ms en los finales
- Tamaño en el dispositivo
- 467 MB de Core ML compilado, descargado bajo demanda
- Idiomas
- 25 idiomas europeos; exactitud del 3,31% (italiano) al 39,46% (griego) en habla leída
- Modelo
- NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), convertido a Core ML y comprimido por Desert Ant Labs: frontend log-mel, codificador conformer, decodificador transductor, todo en el Neural Engine
- Plataformas
- iOS, iPadOS, macOS, tvOS, visionOS (Core ML); navegador y Node (WebAssembly, ONNX Runtime)
La velocidad del Neural Engine es solo para Apple: en iOS, macOS, tvOS y visionOS el runtime controla Core ML para mantener todo el grafo en el Neural Engine. El navegador y Node ejecutan el mismo modelo sobre WebAssembly y ONNX Runtime, más lentamente que en Core ML, y no hay versión nativa para Android.
Voz no sabe cuál de sus 25 idiomas está oyendo, y un idioma que no cubre produce con aplomo un sinsentido en lugar de un error, así que combínalo con Ear. La exactitud varía mucho según el idioma, los finales de palabra son la mitad más difícil de las marcas de tiempo, y 467 MB son una descarga real que traer durante la incorporación.
Preguntas frecuentes
¿Qué es Voz?
Transcribe 10 minutos de audio en 2 s en un iPhone, 14x más rápido que Whisper, con marcas de tiempo precisas por palabra.
¿Voz se ejecuta en el dispositivo?
Sí. Voz se ejecuta en el dispositivo, sin llamadas a servidor, así que los datos se quedan con el usuario.
¿Qué plataformas admite Voz?
Voz se distribuye como un SDK nativo en el dispositivo para Swift, JavaScript / TypeScript.
¿Cuánto cuesta Voz?
Cada modelo es gratis hasta 100 000 dispositivos activos mensuales. La inferencia es ilimitada. Contáctanos para licencias personalizadas.
¿Qué precisión o velocidad tiene Voz?
10 minutos de narración en 2 s en un iPhone 17 Pro, 1,2 s en un iPhone 18 Pro y 2,1 s en un iPhone 15 Pro. En un M3 Ultra, 14x más rápido que whisper.cpp large-v3-turbo con el mismo podcast de 10 minutos, con una tasa de error de palabra del 7,40% en seis conjuntos públicos en inglés donde Whisper obtiene el 7,00%.
¿Voz funciona fuera de las plataformas de Apple?
Sí, en el navegador y en Node. El paquete de JavaScript ejecuta el mismo modelo sobre WebAssembly y ONNX Runtime, así que una app web o un servidor transcribe sin hardware de Apple, incluidos Windows, Linux o el navegador de Android. En Apple silicon todo el modelo se ejecuta en el Neural Engine, que es donde va más rápido. Una versión nativa para Android aún no está lista.