Voz
オンデバイスの音声認識。iPhone で 10 分の音声を 2 秒で文字起こし。Whisper の 14 倍速く、正確な単語タイムスタンプ付き。

10 分の音声を、2 秒で文字起こし。
Voz で音声や動画のファイルを文字起こしすると、すべての単語について正確な開始・終了時刻が得られます。iPhone では 10 分が 2 秒で、端末上で処理されるので、何もアップロードされず、分単位の課金もありません。
Apple silicon では、モデルは Neural Engine 上で動くので、文字起こしは圧倒的に速く、消費電力も抑えられます。Mac なら、ポッドキャスト、インタビュー、講義の過去のアーカイブを一度で処理でき、何もアップロードされません。
タイムスタンプは、それをもとに編集できるほど正確です。単語の開始は強制アライメントに対し 83 ms 以内、終了は 95 ms 以内に収まり、文字起こしに基づく精密な編集ができます。Voz は NVIDIA の Parakeet TDT 0.6B v3 を Apple Neural Engine 向けに最適化したもので、ほとんどの音声で Whisper large-v3-turbo に匹敵する精度を、わずか 467MB のダウンロードサイズで提供します。
Whisper の 14 倍速い。
iPhone 17 Pro で 10 分のナレーションを 2 秒、iPhone 18 Pro で 1.2 秒、iPhone 15 Pro で 2.1 秒で。M3 Ultra では、同じ 10 分のポッドキャスト音声で whisper.cpp の large-v3-turbo より 14 倍速く、6 つの公開英語セットでの単語誤り率は 7.40%(Whisper は 7.00%)です。
10 分の音声を文字起こしする時間。
| 端末 | 時間 | 実時間比 |
|---|---|---|
| M3 Ultra | 0.8s | 762x |
| iPhone 18 Pro | 1.2s | 492x |
| M4 Max | 1.3s | 453x |
| iPhone 17 Pro | 1.8s | 334x |
| iPhone 15 Pro | 2.1s | 283x |
| M1 Mac mini | 2.4s | 251x |
Open ASR Leaderboard のデータセットでの単語誤り率。Voz は独自のテキスト正規化を使用、Whisper の数値はリーダーボードから。
| データセット | Voz | Whisper large-v3-turbo |
|---|---|---|
| LibriSpeech test-clean | 2.19% | 2.13% |
| LibriSpeech test-other | 3.86% | 3.70% |
| GigaSpeech | 9.70% | 8.47% |
| SPGISpeech | 3.86% | 2.79% |
| Earnings-22 | 12.97% | 11.07% |
| AMI | 11.84% | 13.87% |
| Average | 7.40% | 7.00% |
自分の音声に合う行を見て読んでください。クリーンで近接収音された音声は 2〜4% 前後(LibriSpeech、SPGISpeech)、ポッドキャストや Web 動画は 10% 前後(GigaSpeech)、会議室や電話は 12〜13%(AMI、Earnings-22)で、この最後のところがモデルが Whisper を上回る領域です。それぞれ 10 分の朗読音声での言語別の数値はモデルカードにあり、イタリア語の 3.31% からギリシャ語の 39.46% まで幅があります。iPhone のタイミングと whisper.cpp との比較は当社独自の計測で、まだカードには載っていません。
ユースケース
10 分の音声を、2 秒で文字起こし。.
あらゆる音声・動画ファイルを文字起こし
ポッドキャストや動画を録れば、書き出しが終わる前に完全な文字起こしが用意できます。すべての単語にタイムスタンプが付いた検索可能なテキストが、25 言語のいずれでも、デバイスから出ることなく得られます。
たまった録音を一気に処理する
インタビュー、講義、会議録音のアーカイブが、Mac で一度の処理で検索可能になります。100 時間が 20 分で処理され、何もアップロードされません。
単語の位置で切る
すべての単語が開始と終了を持つので、文字起こし上で選んだ範囲が、そのまま動画エディターのカットになります。ショートには Clips、その名前付けには Title を組み合わせましょう。
インスピレーション
Voz で作るためのアイデア。プロンプトをコーディングエージェントにコピーして始めましょう。
Build a podcast player that transcribes every episode and makes it searchable, on the device.
Build a meeting recorder that hands you a timestamped transcript before you leave the room.
Turn voice memos into searchable, editable text notes, offline.
Generate SRT subtitles for any video file on the Mac.
Add captions to a video player that run on the device.
Build an interview app for journalists where sources never leave the phone.
Build a full podcast studio: transcribe, clip, and title on the device.
Record, clean, transcribe, and clip: a whole creator pipeline, offline.
モデルができること
- 強制アライメントに対し、平均で単語の開始は 83 ms 以内、終了は 95 ms 以内。フレーム分解能は 80 ms。
- iPhone 17 Pro で 10 分の音声を 2 秒、iPhone 18 Pro で 1.2 秒、iPhone 15 Pro で 2.1 秒。M3 Ultra で実時間の 762 倍、0.8 秒。短いクリップ単体では 50〜62 倍で、どのクリップも 15 秒ぶんの窓のコストを払うためです。
- Open ASR Leaderboard の 6 セット平均で単語誤り率 7.40%(Whisper large-v3-turbo は 7.00%)、30 分のナレーションで 2.83%(Whisper は 2.72%)、AMI の会議で 11.84%(Whisper は 13.87%)。
- グラフ全体が Neural Engine 上で動き、CPU や GPU へのフォールバックはありません。ピークメモリは録音の長さに応じて増えません。
- 25 言語:ブルガリア語、クロアチア語、チェコ語、デンマーク語、オランダ語、英語、エストニア語、フィンランド語、フランス語、ドイツ語、ギリシャ語、ハンガリー語、イタリア語、ラトビア語、リトアニア語、マルタ語、ポーランド語、ポルトガル語、ルーマニア語、ロシア語、スロバキア語、スロベニア語、スペイン語、スウェーデン語、ウクライナ語。
- ディスク上で 467MB、必要に応じてダウンロードされキャッシュされます。ダウンロード後の初回読み込みは、Core ML が特殊化する間だけ一度 20 秒かかり、その後は 0.2 秒です。オンボーディング中にダウンロードしてください。
- サンプルレートを問わないモノラル音声に対応し、SDK がリサンプリングとダウンミックスを行います。長い音声は休止のところで 15 秒の窓に分割され、隣り合う窓が一致した単語でつなぎ合わされます。
- CC BY 4.0 で公開された NVIDIA の Parakeet TDT 0.6B v3 を基盤にしています。重みは変更しておらず、変換、圧縮、Neural Engine のランタイムが当社によるものです。
サンプルアプリ
Clipper
Voz, Clips, Title で構築
Generate short clips from a video podcast or a long recording, fully on device. A macOS app and a command-line tool over the same core.
Voz transcribes with a time on every word, Clips ranks the best spans, and Title writes a title and description for each.
macOS 26 or later, Apple Silicon
brew tap desert-ant-labs/tap
brew install --cask clipper
はじめに
音声認識 を、数行のコードで iOS or macOS or web アプリに追加。 Voz のドキュメント.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Voz", package: "desert-ant-core")
import Voz
let voz = try await Voz()
let result = try await voz.transcribe(url)
result.text // the transcript
result.words.first?.start // 80ms resolution
result.realtimeFactor // seconds of audio per second of wall clock
Add Voz from Desert Ant Labs to this Swift project (iOS, macOS). What it does: Voz:Neural Engine で動くオンデバイスの音声認識. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0") // target dependency .product(name: "Voz", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/voz/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/voz onnxruntime-web
import { Voz } from "@desert-ant-labs/voz";
const voz = await Voz.load();
const result = await voz.transcribe(file); // File, Blob, ArrayBuffer, or samples
result.text;
result.words[0]; // { text, start, end }
result.realtimeFactor;
Add Voz from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: Voz:Neural Engine で動くオンデバイスの音声認識. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/voz onnxruntime-web Reference: - Model page: https://desertant.com/models/voz/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
仕様
- 速度
- Mac と iPhone で 10 分の音声を 0.8〜2.4 秒、実時間の 251〜762 倍。端末ごとの時間はパフォーマンスに掲載
- 精度
- Open ASR Leaderboard の 6 セットで WER 7.40%、長尺で 2.83%。単語の開始は平均誤差 83 ms、終了は 95 ms
- オンデバイスサイズ
- コンパイル済み Core ML で 467MB、必要に応じてダウンロード
- 言語
- 欧州 25 言語。朗読音声での精度はイタリア語の 3.31% からギリシャ語の 39.46% まで
- モデル
- NVIDIA Parakeet TDT 0.6B v3(CC BY 4.0)を、Desert Ant Labs が Core ML に変換・圧縮。対数メルのフロントエンド、Conformer エンコーダー、Transducer デコーダーがすべて Neural Engine 上で動作
- プラットフォーム
- iOS、iPadOS、macOS、tvOS、visionOS(Core ML)。ブラウザと Node(WebAssembly、ONNX Runtime)
Neural Engine の速度は Apple 専用です。iOS、macOS、tvOS、visionOS では、ランタイムが Core ML を駆動してグラフ全体を Neural Engine 上に保ちます。ブラウザと Node は同じモデルを WebAssembly と ONNX Runtime 上で動かしますが、Core ML より遅く、ネイティブの Android ビルドはありません。Voz は、対応する 25 言語のうちどれを聞いているかを判別しないので、対応していない言語ではエラーではなく自信満々のでたらめを返します。そのため Ear と組み合わせてください。精度は言語によって大きく変わり、単語の終わりはタイムスタンプのなかでも難しい方で、467MB はオンボーディング中に落とすにはそれなりに大きいダウンロードです。
FAQ
Voz とは?
オンデバイスの音声認識。iPhone で 10 分の音声を 2 秒で文字起こし。Whisper の 14 倍速く、正確な単語タイムスタンプ付き。
Voz はオンデバイスで動作しますか?
はい。Voz はデバイス上で動作し、サーバーへの通信は発生しません。データはユーザーの手元に残ります。
Voz はどのプラットフォームに対応していますか?
Voz は Swift, JavaScript / TypeScript 向けのネイティブなオンデバイス SDK として提供されます。
Voz の料金はいくらですか?
各モデルは月間アクティブデバイス 100k 台まで無料です。推論は無制限です。 カスタムライセンスについては、お問い合わせください。
Voz の精度や速度はどれくらいですか?
iPhone 17 Pro で 10 分のナレーションを 2 秒、iPhone 18 Pro で 1.2 秒、iPhone 15 Pro で 2.1 秒で。M3 Ultra では、同じ 10 分のポッドキャスト音声で whisper.cpp の large-v3-turbo より 14 倍速く、6 つの公開英語セットでの単語誤り率は 7.40%(Whisper は 7.00%)です。
Voz は Apple プラットフォーム以外でも動きますか?
はい、ブラウザと Node で動きます。JavaScript パッケージは同じモデルを WebAssembly と ONNX Runtime 上で動かすので、Web アプリやサーバーは Apple のハードウェアなしで、Windows、Linux、Android のブラウザでも文字起こしできます。Apple silicon ではモデル全体が Neural Engine 上で動き、そこが最も高速です。ネイティブの Android ビルドはまだ用意できていません。