Align
Wortgenaue Zeitstempel auf dem Gerät, für jede Transkription. Schneiden, untertiteln und hervorheben auf das Wort genau, fünfmal genauer, ab 0,7 MB.

Genaue Wort-Zeitstempel für jedes Transkript.
Apple sagt, „Welt“ läuft von 2,61 bis 3,04 Sekunden. Align sagt 2,57 bis 2,98. Schneiden Sie dort, und der Schnitt ist sauber, der Untertitel leuchtet auf das Wort genau auf, und die Hervorhebung beginnt dort, wo der Sprecher begann.
Sie behalten Apples Transkribierer. Align liest dasselbe Audio, das SpeechAnalyzer ohnehin bekommt, und gibt dieselben Wörter mit engeren Start- und Endzeiten zurück, in wenigen Millisekunden, aus einem 0,7 MB großen Download. Bei sauberem Audio senkt das Apples durchschnittliche Abweichung von 113 ms auf 45 ms.
Ein Wort, das Align nicht verbessern kann, behält Apples Zeitangabe, sodass eine Korrektur nur helfen oder das Wort in Ruhe lassen kann. Neun Sprachen, und eine Sprache außerhalb davon wird mit Apples Zeitangaben unverändert durchgereicht.
Fünfmal genauer.
Apples wortgenaue Zeiten auf LibriSpeech test-clean liegen im Mittel 106,4 ms daneben; Align bringt das auf 20,2 ms, und 95 % der Wörter liegen innerhalb von 50 ms, aus einem Modell von 0,7 MB.
Mittlerer absoluter Abstand zur Referenz-Wortgrenze, in einer Stichprobe von 500 Clips je offiziellem LibriSpeech-Split, ohne gemeinsame Sprecher zwischen Training und Auswertung
| Split | Apple roh | Align | Innerhalb 50 ms |
|---|---|---|---|
| test-clean | 106,4 ms | 20,2 ms | 95 % |
| test-other | 111,6 ms | 24,8 ms | 92 % |
Ausgewertet auf den v1.0.0-Gewichten. Die Referenzen sind maschinelle Forced-Alignment-Schätzungen aus Qwen3-ForcedAligner, gemittelt mit einem zweiten Aligner, keine menschlichen Annotationen: die Zahlen zeigen eine große und konsistente Verringerung des Zeitfehlers, keine exakte Wahrheit auf Stichprobenebene. Ausnahme ist der Vergleich mit WhisperX, gemessen an 258 Wortgrenzen, die ein Mensch anhand der Wellenform von Hand korrigiert hat.
Anwendungsfälle
Genaue Wort-Zeitstempel für jedes Transkript.
Wort-für-Wort-Untertitel, die mithalten
Lassen Sie jedes Wort aufleuchten, während es gesprochen wird, in einer Untertitelansicht, einem Karaoke-artigen Textbildschirm oder einer Sprachlern-App, aus Apples Transkript. Die Zeiten treffen das Wort, statt eine Zehntelsekunde daneben zu liegen.
Einen Clip auf ein Wort schneiden
Kürzen Sie eine Aufnahme in einem Podcast-Editor oder einer Video-App auf ein Zitat, und lassen Sie den Schnitt dort beginnen, wo das Wort beginnt. Kein Frame des vorigen Wortes, kein abgeschnittener Konsonant und kein manuelles Verschieben auf der Zeitleiste.
Das gesprochene Wort im Transkript hervorheben
Scrollen Sie ein Transkript im Takt der Wiedergabe in einem Meeting-Recorder oder einer Vorlesungs-App, wobei die Hervorhebung auf das Wort genau mitwandert, statt dem Audio vorauszueilen.
Suche, die den Moment trifft
Springen Sie in einem Archiv von Aufnahmen auf die Sekunde, in der ein Wort gesagt wurde, auf dem Gerät. Die Zeiten sind eng genug, dass der Abspielkopf auf dem Wort startet und nicht mitten im vorigen.
Inspiration
Ideen zum Bauen mit Align. Kopieren Sie einen Prompt in Ihren Coding-Agenten und los.
Highlight each word as it's spoken, timed to the audio.
Tighten a system transcriber's word timings so captions land on the word.
Build a text-based video editor where selecting words trims the clip.
Add bouncing word-by-word captions to vertical videos.
Make transcript search jump the audio to the exact word.
Was das Modell macht
- Korrigiert die Zeitangaben auf Wortebene, die Apples
SpeechTranscriberundSpeechAnalyzerzurückgeben, ohne sie zu ersetzen: dieselben Wörter, dieselbe Ergebnisfläche, engereaudioTimeRange-Werte. - Mittlerer Zeitfehler von 124,2 ms auf 43,9 ms, makro-gemittelt über alle neun Sprachen, damit keine Sprache den Wert allein trägt. Im Englischen geht es weiter: von 106,4 ms auf 20,2 ms.
- In einer Stichprobe von 500 Clips aus LibriSpeech test-clean liegen 95 % der Wörter innerhalb von 50 ms der Referenz, zuvor 37 %. Das schlechteste Zehntel verbessert sich am stärksten: von 230,7 ms auf 33,0 ms, etwa ein Videobild bei 30 fps.
- Ein struktureller Fallback behält Apples ursprünglichen Zeitstempel, wann immer eine Korrektur ungültig wäre, an den Rand des Suchfensters stößt oder keinen Streaming-Kontext hat.
- Neun Sprachen: Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Deutsch, Japanisch, Koreanisch und Chinesisch. Andere Sprachen werden unverändert durchgereicht.
- Rund 0,7 MB kompiliertes Core ML in zwei Stufen, ausgeführt auf CPU und Neural Engine; ein typisches Ergebnis ist in wenigen Millisekunden korrigiert.
Erste Schritte
Fügen Sie wort-zeitstempel mit wenigen Zeilen Code zu Ihrer iOS or macOS or web-App hinzu. Align Docs.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let align = Align()
guard try await align.isSupported(languageCode: "en") else { return words }
let fixed = try await align.refine(words, audio: samples, sampleRate: 16_000, languageCode: "en")
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: On-Device-Wort-Zeitstempel für jedes Transkript. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/align
import { Align } from "@desert-ant-labs/align/native";
const align = await Align.load();
const fixed = await align.refine(samples, 16000, words, { language: "en" });
align.dispose();
Add Align from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: On-Device-Wort-Zeitstempel für jedes Transkript. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/align Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Technische Daten
- Genauigkeit
- 20,2 ms mittlerer Fehler auf LibriSpeech test-clean gegenüber Apples 106,4 ms, und 43,9 ms über alle neun Sprachen gegenüber Apples 124,2 ms
- Größe auf dem Gerät
- Rund 0,7 MB kompiliertes Core ML (zwei Stufen mit je 0,3 MB, dazu Filterbank und Kalibrator)
- Sprachen
- Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Deutsch, Japanisch, Koreanisch, Chinesisch
- Modell
- Zweistufige Kaskade von grob nach fein über ein Log-Mel-Spektrogramm mit einem Gradient-Boosting-Kalibrator
- Plattformen
- iOS 26, macOS 26, tvOS 26, visionOS 26 auf Core ML, dazu Linux, Windows und Node auf LiteRT
Align korrigiert die Zeiten einer Transkription; es transkribiert nicht. Der StreamingRefiner, der sich an Apples SpeechAnalyzer anschließt, braucht iOS 26, macOS 26, tvOS 26 oder visionOS 26.
Die Offline-Funktion Align.refine korrigiert die Wörter jeder Transkription eigenständig und läuft über LiteRT auf Linux, Windows und Node.
Align verspricht nicht, jedes Wort zu verbessern. Der Fallback, der den ursprünglichen Zeitstempel behält, fängt Korrekturen ab, die unsicher aussehen, nicht jede falsche.
Gesprochene Zahlen sind der schwächste Fall: in einer kleinen Stichprobe hat die Korrektur die Ziffergrenzen weiter von der Referenz weggerückt, statt sie zu lassen.
FAQ
Was ist Align?
Wortgenaue Zeitstempel auf dem Gerät, für jede Transkription. Schneiden, untertiteln und hervorheben auf das Wort genau, fünfmal genauer, ab 0,7 MB.
Läuft Align auf dem Gerät?
Ja. Align läuft auf dem Gerät, ohne Serveraufruf, sodass die Daten beim Nutzer bleiben.
Welche Plattformen unterstützt Align?
Align wird als natives On-Device-SDK für Swift, JavaScript / TypeScript ausgeliefert.
Was kostet Align?
Jedes Modell ist kostenlos für bis zu 100k monatlich aktive Geräte. Die Inferenz ist unbegrenzt. Kontaktieren Sie uns für individuelle Lizenzen.
Wie genau oder schnell ist Align?
Apples wortgenaue Zeiten auf LibriSpeech test-clean liegen im Mittel 106,4 ms daneben; Align bringt das auf 20,2 ms, und 95 % der Wörter liegen innerhalb von 50 ms, aus einem Modell von 0,7 MB.