Desert Ant Labs

Voz

TaligenkänningTillgänglig

Transkribera 10 minuter ljud på 2 s på en iPhone, 14x snabbare än Whisper, exakta ordtidsstämplar.

Transkribera 10 minuter på 2 sekunder.

Transkribera en ljud- eller videofil med Voz och få exakta start- och sluttider för varje ord. 10 minuter tar 2 s på en iPhone, på enheten, så inget laddas upp och inget faktureras per minut.

På Apple-kisel körs modellen på Neural Engine, så transkriberingen är blixtsnabb och drar mindre ström. På en Mac körs en backkatalog av poddar, intervjuer och föreläsningar igenom i en enda genomgång, och inget laddas upp.

Tidsstämplarna är precisa nog att redigera på. Ordstarter landar inom 83 ms från en forced aligner och ordslut inom 95 ms, för precis transkriptbaserad redigering. Voz är en version av NVIDIA:s Parakeet TDT 0.6B v3 optimerad för Apple Neural Engine, med noggrannhet jämförbar med Whisper large-v3-turbo på de flesta ljud, med en nedladdningsstorlek på bara 467 MB.

14x snabbare än Whisper.

10 minuter berättarröst på 2 s på en iPhone 17 Pro, 1,2 s på en iPhone 18 Pro och 2,1 s på en iPhone 15 Pro. På en M3 Ultra, 14x snabbare än whisper.cpp large-v3-turbo på samma 10-minuters poddljud, med en ordfelfrekvens på 7,40% på sex offentliga engelska uppsättningar där Whisper får 7,00%.

0.0s
0:00 / 10:00

Ljud: Ant Ventures, en LibriVox-inspelning, allmän egendom.

2s
10 minuter ljud
iPhone 17 Pro, på Neural Engine
14x
Snabbare än Whisper
large-v3-turbo via whisper.cpp, 10 min, M3 Ultra
7,40%
Ordfelfrekvens
sex uppsättningar från Open ASR Leaderboard; Whisper large-v3-turbo 7,00%
467MB
På disk
Whisper large-v3-turbo: 1,6 GB vid fp16

Tid att transkribera 10 minuter ljud.

EnhetTidRealtidsfaktor
M3 Ultra0,8s762x
iPhone 18 Pro1,2s492x
M4 Max1,3s453x
iPhone 17 Pro1,8s334x
iPhone 15 Pro2,1s283x
M1 Mac mini2,4s251x

Ordfelfrekvens på datauppsättningarna från Open ASR Leaderboard, Voz med sin egen textnormaliserare, Whispers siffror från topplistan

DatauppsättningVozWhisper large-v3-turbo
LibriSpeech test-clean2,19%2,13%
LibriSpeech test-other3,86%3,70%
GigaSpeech9,70%8,47%
SPGISpeech3,86%2,79%
Earnings-2212,97%11,07%
AMI11,84%13,87%
Average7,40%7,00%

Läs raden som matchar ditt ljud. Rent, tätt inmikat tal hamnar runt 2–4% (LibriSpeech, SPGISpeech), poddar och webbvideo runt 10% (GigaSpeech), och mötesrum och telefonsamtal 12–13% (AMI, Earnings-22), vilket är där modellen slår Whisper. Siffror per språk på 10 minuter uppläst tal vardera finns på modellkortet, från 3,31% för italienska till 39,46% för grekiska. iPhone-tiderna och jämförelsen med whisper.cpp är våra egna körningar och finns inte på kortet ännu.

Användningsfall

Transkribera 10 minuter på 2 sekunder.

Transkribera vilken ljud- eller videofil som helst

Spela in en podd eller en video och hela transkriptet är klart innan exporten är färdig. Sökbar text med en tidsstämpel på varje ord, på vilket som helst av 25 språk, utan att lämna enheten.

Mala igenom en eftersläpning

Ett arkiv av intervjuer, föreläsningar eller mötesinspelningar blir sökbart i en enda genomgång på en Mac. Hundra timmar körs igenom på 20 minuter, och inget laddas upp.

Klipp på ett ord

Varje ord bär en start och ett slut, så ett markerat intervall i transkriptet är ett klipp i en videoredigerare. Kombinera den med Clips för shorts och Title för att namnge dem.

Inspiration

Idéer att bygga med Voz. Kopiera en prompt till din kodningsagent och kör.

Voz

Build a podcast player that transcribes every episode and makes it searchable, on the device.

Kopiera prompt
Voz

Build a meeting recorder that hands you a timestamped transcript before you leave the room.

Kopiera prompt
Voz

Turn voice memos into searchable, editable text notes, offline.

Kopiera prompt
Voz

Generate SRT subtitles for any video file on the Mac.

Kopiera prompt
Voz

Add captions to a video player that run on the device.

Kopiera prompt
Voz

Build an interview app for journalists where sources never leave the phone.

Kopiera prompt
VozClipsTitle

Build a full podcast studio: transcribe, clip, and title on the device.

Kopiera prompt
ClearVozClips

Record, clean, transcribe, and clip: a whole creator pipeline, offline.

Kopiera prompt
Se alla 26 idéer

Vad modellen gör

  • Ordstarter inom 83 ms och ordslut inom 95 ms från en forced aligner, i genomsnitt, vid 80 ms ramupplösning.
  • 10 minuter ljud på 2 s på en iPhone 17 Pro, 1,2 s på en iPhone 18 Pro och 2,1 s på en iPhone 15 Pro. På en M3 Ultra, 0,8 s vid 762x realtid. Enskilda korta klipp körs 50–62x, eftersom varje klipp betalar för ett helt 15 s-fönster.
  • 7,40% ordfelfrekvens i genomsnitt över sex uppsättningar från Open ASR Leaderboard (Whisper large-v3-turbo: 7,00%), 2,83% på en halvtimmes berättarröst (Whisper: 2,72%), 11,84% på AMI-möten (Whisper: 13,87%).
  • Hela grafen körs på Neural Engine utan CPU- eller GPU-reserv; toppminnet växer inte med inspelningens längd.
  • 25 språk: bulgariska, kroatiska, tjeckiska, danska, nederländska, engelska, estniska, finska, franska, tyska, grekiska, ungerska, italienska, lettiska, litauiska, maltesiska, polska, portugisiska, rumänska, ryska, slovakiska, slovenska, spanska, svenska och ukrainska.
  • 467 MB på disk, nedladdad vid behov och cachad; den första laddningen efter en nedladdning tar 20 s en gång medan Core ML specialiserar, sedan 0,2 s. Ladda ned under onboarding.
  • Monoljud i valfri samplingsfrekvens; SDK:n omsamplar och nedmixar. Längre ljud klipps i 15 s-fönster vid pauser och fogas samman på de ord som angränsande fönster är överens om.
  • Byggd på NVIDIA:s Parakeet TDT 0.6B v3, släppt under CC BY 4.0. Vikterna är oförändrade; konverteringen, kompressionen och Neural Engine-runtimen är våra.

Exempelapp

Clipper

Byggd med Voz, Clips, Title

Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.

Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.

macOS 26 or later, Apple Silicon

Installera med Homebrew
brew tap desert-ant-labs/tap
brew install --cask clipper

Kom igång

Lägg till taligenkänning i din iOS or macOS or web-app med några rader kod. Voz-dokumentation.

iOS, macOS
Installera
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
Exempel - Swift
import Voz

let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text                     // the transcript
result.words.first?.start       // 80ms resolution
result.realtimeFactor           // seconds of audio per second of wall clock
Bygg med en prompt
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: Tal till text på enheten på Neural Engine.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/voz/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidKommer snart
Web, Node.js
Installera
npm i @desert-ant-labs/voz onnxruntime-web
Exempel - TypeScript
import { Voz } from "@desert-ant-labs/voz";

const voz = await Voz.load();
const result = await voz.transcribe(file);   // File, Blob, ArrayBuffer, or samples
result.text;
result.words[0];        // { text, start, end }
result.realtimeFactor;
Bygg med en prompt
Add Voz from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js).

What it does: Tal till text på enheten på Neural Engine.

SDK:

JavaScript / TypeScript (Web, Node.js)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
npm i @desert-ant-labs/voz onnxruntime-web

Reference:
- Model page: https://desertant.com/models/voz/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.

Specifikationer

Hastighet
10 minuter ljud på 0,8–2,4 s på Mac och iPhone, 251–762x realtid; tider per enhet under Prestanda
Noggrannhet
7,40% WER över sex uppsättningar från Open ASR Leaderboard; 2,83% långform; ordstarter 83 ms, ordslut 95 ms genomsnittligt fel
Storlek på enheten
467 MB kompilerad Core ML, nedladdad vid behov
Språk
25 europeiska språk; noggrannhet från 3,31% (italienska) till 39,46% (grekiska) på uppläst tal
Modell
NVIDIA Parakeet TDT 0.6B v3 (CC BY 4.0), konverterad till Core ML och komprimerad av Desert Ant Labs: log-mel-frontend, conformer-encoder, transducer-decoder, allt på Neural Engine
Plattformar
iOS, iPadOS, macOS, tvOS, visionOS (Core ML); webbläsare och Node (WebAssembly, ONNX Runtime)

Hastigheten på Neural Engine gäller bara Apple: på iOS, macOS, tvOS och visionOS driver runtimen Core ML för att hålla hela grafen på Neural Engine. Webbläsaren och Node kör samma modell på WebAssembly och ONNX Runtime, långsammare än Core ML, och det finns inget nativt Android-bygge.

Voz vet inte vilket av sina 25 språk den hör, och ett språk den inte täcker ger självsäkert nonsens snarare än ett fel, så kombinera den med Ear. Noggrannheten varierar kraftigt mellan språk, ordslut är den svårare halvan av tidsstämplarna, och 467 MB är en verklig nedladdning att hämta under onboarding.

Vanliga frågor

Vad är Voz?

Transkribera 10 minuter ljud på 2 s på en iPhone, 14x snabbare än Whisper, exakta ordtidsstämplar.

Körs Voz lokalt på enheten?

Ja. Voz körs på enheten, utan något serveranrop, så att data stannar hos användaren.

Vilka plattformar stöder Voz?

Voz levereras som en nativ SDK på enheten för Swift, JavaScript / TypeScript.

Vad kostar Voz?

Varje modell är gratis upp till 100k månadsaktiva enheter. Inferensen är obegränsad. Kontakta oss för anpassade licenser.

Hur träffsäker eller snabb är Voz?

10 minuter berättarröst på 2 s på en iPhone 17 Pro, 1,2 s på en iPhone 18 Pro och 2,1 s på en iPhone 15 Pro. På en M3 Ultra, 14x snabbare än whisper.cpp large-v3-turbo på samma 10-minuters poddljud, med en ordfelfrekvens på 7,40% på sex offentliga engelska uppsättningar där Whisper får 7,00%.

Körs Voz utanför Apples plattformar?

Ja, i webbläsaren och i Node. JavaScript-paketet kör samma modell på WebAssembly och ONNX Runtime, så en webbapp eller en server transkriberar utan Apple-hårdvara, på Windows, Linux eller i en Android-webbläsare. På Apple-kisel körs hela modellen på Neural Engine, vilket är där den är snabbast. Ett nativt Android-bygge är inte klart ännu.

Resurser