Desert Ant Labs

Voz

Reconocimiento de vozDisponible

Transcribe 10 minutos de audio en 2 s en un iPhone, 14x más rápido que Whisper, con marcas de tiempo precisas por palabra.

Transcribe 10 minutos en 2 segundos.

Transcribe un archivo de audio o vídeo con Voz y obtén tiempos de inicio y fin precisos para cada palabra. 10 minutos tardan 2 s en un iPhone, en el dispositivo, así que no se sube nada y no se cobra por minuto.

En Apple silicon, el modelo se ejecuta en el Neural Engine, así que transcribir es ultrarrápido y consume menos energía. En un Mac, un catálogo antiguo de podcasts, entrevistas y clases se procesa de una sola pasada, y no se sube nada.

Las marcas de tiempo son lo bastante precisas para editar sobre ellas. Los inicios de palabra caen a menos de 83 ms de un alineador forzado y los finales a menos de 95 ms, para una edición precisa basada en la transcripción. Voz es una versión de Parakeet TDT 0.6B v3 de NVIDIA optimizada para el Apple Neural Engine, con una exactitud comparable a la de Whisper large-v3-turbo en la mayoría del audio, y un tamaño de descarga de solo 467 MB.

14x más rápido que Whisper.

10 minutos de narración en 2 s en un iPhone 17 Pro, 1,2 s en un iPhone 18 Pro y 2,1 s en un iPhone 15 Pro. En un M3 Ultra, 14x más rápido que whisper.cpp large-v3-turbo con el mismo podcast de 10 minutos, con una tasa de error de palabra del 7,40% en seis conjuntos públicos en inglés donde Whisper obtiene el 7,00%.

0.0s
0:00 / 10:00

Audio: Ant Ventures, una grabación de LibriVox, dominio público.

2 s
10 minutos de audio
iPhone 17 Pro, en el Neural Engine
14x
Más rápido que Whisper
large-v3-turbo con whisper.cpp, 10 min, M3 Ultra
7,40%
Tasa de error de palabra
seis conjuntos del Open ASR Leaderboard; Whisper large-v3-turbo 7,00%
467 MB
En disco
Whisper large-v3-turbo: 1,6 GB en fp16

Tiempo de transcripción de 10 minutos de audio.

DispositivoTiempoTiempo real
M3 Ultra0,8 s762x
iPhone 18 Pro1,2 s492x
M4 Max1,3 s453x
iPhone 17 Pro1,8 s334x
iPhone 15 Pro2,1 s283x
M1 Mac mini2,4 s251x

Tasa de error de palabra en los conjuntos del Open ASR Leaderboard, Voz con su propio normalizador de texto, las cifras de Whisper tomadas del leaderboard

Conjunto de datosVozWhisper large-v3-turbo
LibriSpeech test-clean2,19%2,13%
LibriSpeech test-other3,86%3,70%
GigaSpeech9,70%8,47%
SPGISpeech3,86%2,79%
Earnings-2212,97%11,07%
AMI11,84%13,87%
Average7,40%7,00%

Lee la fila que coincide con tu audio. El habla limpia y con micrófono cercano ronda el 2-4% (LibriSpeech, SPGISpeech), los podcasts y el vídeo web en torno al 10% (GigaSpeech), y las salas de reuniones y las llamadas telefónicas el 12-13% (AMI, Earnings-22), que es donde el modelo supera a Whisper. Las cifras por idioma sobre 10 minutos de habla leída cada una están en la ficha del modelo, del 3,31% del italiano al 39,46% del griego. Los tiempos en iPhone y la comparación con whisper.cpp son ejecuciones propias y aún no están en la ficha.

Casos de uso

Transcribe 10 minutos en 2 segundos.

Transcribe cualquier archivo de audio o vídeo

Graba un podcast o un vídeo y la transcripción completa está lista antes de que termine la exportación. Texto en el que puedes buscar con una marca de tiempo en cada palabra, en cualquiera de los 25 idiomas, sin salir del dispositivo.

Despacha el trabajo acumulado

Una biblioteca de entrevistas, clases o grabaciones de reuniones se vuelve consultable de una sola pasada en un Mac. Cien horas se procesan en 20 minutos, y no se sube nada.

Corta en una palabra

Cada palabra lleva un inicio y un fin, así que un rango seleccionado en la transcripción es un corte en un editor de vídeo. Combínalo con Clips para los shorts y con Title para nombrarlos.

Inspiración

Ideas para crear con Voz. Copia un prompt en tu agente de código y adelante.

Voz

Build a podcast player that transcribes every episode and makes it searchable, on the device.

Copiar prompt
Voz

Build a meeting recorder that hands you a timestamped transcript before you leave the room.

Copiar prompt
Voz

Turn voice memos into searchable, editable text notes, offline.

Copiar prompt
Voz

Generate SRT subtitles for any video file on the Mac.

Copiar prompt
Voz

Add captions to a video player that run on the device.

Copiar prompt
Voz

Build an interview app for journalists where sources never leave the phone.

Copiar prompt
VozClipsTitle

Build a full podcast studio: transcribe, clip, and title on the device.

Copiar prompt
ClearVozClips

Record, clean, transcribe, and clip: a whole creator pipeline, offline.

Copiar prompt
Ver las 26 ideas

Qué hace el modelo

  • Los inicios de palabra caen a menos de 83 ms y los finales a menos de 95 ms de un alineador forzado, de media, con una resolución de trama de 80 ms.
  • 10 minutos de audio en 2 s en un iPhone 17 Pro, 1,2 s en un iPhone 18 Pro y 2,1 s en un iPhone 15 Pro. En un M3 Ultra, 0,8 s a 762x en tiempo real. Los clips cortos sueltos van a 50-62x, porque cada clip paga una ventana completa de 15 s.
  • Tasa de error de palabra del 7,40% de media en seis conjuntos del Open ASR Leaderboard (Whisper large-v3-turbo: 7,00%), 2,83% en media hora de narración (Whisper: 2,72%), 11,84% en las reuniones de AMI (Whisper: 13,87%).
  • Todo el grafo se ejecuta en el Neural Engine sin recurrir a la CPU ni a la GPU; la memoria máxima no crece con la duración de la grabación.
  • 25 idiomas: búlgaro, croata, checo, danés, neerlandés, inglés, estonio, finés, francés, alemán, griego, húngaro, italiano, letón, lituano, maltés, polaco, portugués, rumano, ruso, eslovaco, esloveno, español, sueco y ucraniano.
  • 467 MB en disco, descargado bajo demanda y guardado en caché; la primera carga tras la descarga tarda 20 s una vez mientras Core ML se especializa, y luego 0,2 s. Descárgalo durante la incorporación.
  • Audio mono a cualquier frecuencia de muestreo; el SDK remuestrea y mezcla a mono. El audio más largo se divide en ventanas de 15 s en las pausas y se une por las palabras en las que coinciden las ventanas contiguas.
  • Construido sobre Parakeet TDT 0.6B v3 de NVIDIA, publicado bajo CC BY 4.0. Los pesos no se modifican; la conversión, la compresión y el runtime para el Neural Engine son nuestros.

Aplicación de ejemplo

Clipper

Creado con Voz, Clips, Title

Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.

Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.

macOS 26 or later, Apple Silicon

Instalar con Homebrew
brew tap desert-ant-labs/tap
brew install --cask clipper

Primeros pasos

Añade reconocimiento de voz a tu app de iOS or macOS or web con unas pocas líneas de código. Docs de Voz.

iOS, macOS
Instalación
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
Ejemplo - Swift
import Voz

let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text                     // the transcript
result.words.first?.start       // 80ms resolution
result.realtimeFactor           // seconds of audio per second of wall clock
Crea con un prompt
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: voz a texto en el dispositivo en el Neural Engine.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/voz/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidPróximamente
Web, Node.js
Instalación
npm i @desert-ant-labs/voz onnxruntime-web
Ejemplo - TypeScript
import { Voz } from "@desert-ant-labs/voz";

const voz = await Voz.load();
const result = await voz.transcribe(file);   // File, Blob, ArrayBuffer, or samples
result.text;
result.words[0];        // { text, start, end }
result.realtimeFactor;
Crea con un prompt
Add Voz from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js).

What it does: voz a texto en el dispositivo en el Neural Engine.

SDK:

JavaScript / TypeScript (Web, Node.js)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
npm i @desert-ant-labs/voz onnxruntime-web

Reference:
- Model page: https://desertant.com/models/voz/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.

Especificaciones

Velocidad
10 minutos de audio en 0,8 s a 2,4 s en Mac y iPhone, 251x a 762x en tiempo real; tiempos por dispositivo en Rendimiento
Exactitud
7,40% de WER en seis conjuntos del Open ASR Leaderboard; 2,83% en formato largo; error medio de 83 ms en los inicios de palabra y 95 ms en los finales
Tamaño en el dispositivo
467 MB de Core ML compilado, descargado bajo demanda
Idiomas
25 idiomas europeos; exactitud del 3,31% (italiano) al 39,46% (griego) en habla leída
Modelo
NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), convertido a Core ML y comprimido por Desert Ant Labs: frontend log-mel, codificador conformer, decodificador transductor, todo en el Neural Engine
Plataformas
iOS, iPadOS, macOS, tvOS, visionOS (Core ML); navegador y Node (WebAssembly, ONNX Runtime)

La velocidad del Neural Engine es solo para Apple: en iOS, macOS, tvOS y visionOS el runtime controla Core ML para mantener todo el grafo en el Neural Engine. El navegador y Node ejecutan el mismo modelo sobre WebAssembly y ONNX Runtime, más lentamente que en Core ML, y no hay versión nativa para Android.

Voz no sabe cuál de sus 25 idiomas está oyendo, y un idioma que no cubre produce con aplomo un sinsentido en lugar de un error, así que combínalo con Ear. La exactitud varía mucho según el idioma, los finales de palabra son la mitad más difícil de las marcas de tiempo, y 467 MB son una descarga real que traer durante la incorporación.

Preguntas frecuentes

¿Qué es Voz?

Transcribe 10 minutos de audio en 2 s en un iPhone, 14x más rápido que Whisper, con marcas de tiempo precisas por palabra.

¿Voz se ejecuta en el dispositivo?

Sí. Voz se ejecuta en el dispositivo, sin llamadas a servidor, así que los datos se quedan con el usuario.

¿Qué plataformas admite Voz?

Voz se distribuye como un SDK nativo en el dispositivo para Swift, JavaScript / TypeScript.

¿Cuánto cuesta Voz?

Cada modelo es gratis hasta 100 000 dispositivos activos mensuales. La inferencia es ilimitada. Contáctanos para licencias personalizadas.

¿Qué precisión o velocidad tiene Voz?

10 minutos de narración en 2 s en un iPhone 17 Pro, 1,2 s en un iPhone 18 Pro y 2,1 s en un iPhone 15 Pro. En un M3 Ultra, 14x más rápido que whisper.cpp large-v3-turbo con el mismo podcast de 10 minutos, con una tasa de error de palabra del 7,40% en seis conjuntos públicos en inglés donde Whisper obtiene el 7,00%.

¿Voz funciona fuera de las plataformas de Apple?

Sí, en el navegador y en Node. El paquete de JavaScript ejecuta el mismo modelo sobre WebAssembly y ONNX Runtime, así que una app web o un servidor transcribe sin hardware de Apple, incluidos Windows, Linux o el navegador de Android. En Apple silicon todo el modelo se ejecuta en el Neural Engine, que es donde va más rápido. Una versión nativa para Android aún no está lista.

Recursos