Align
Marcature temporali per parola sul dispositivo, per qualsiasi trascrittore. Taglia, sottotitola ed evidenzia con cinque volte più precisione, da 0,7 MB.

Timestamp per parola precisi per ogni trascrizione.
Apple dice che «world» va da 2,61 a 3,04 secondi. Align dice da 2,57 a 2,98. Taglia lì e il taglio è pulito, il sottotitolo si accende sulla parola, e l'evidenziazione parte da dove è partito chi parla.
Tieni il trascrittore di Apple. Align legge lo stesso audio che SpeechAnalyzer riceve già e restituisce le stesse parole con tempi di inizio e fine più precisi, in pochi millisecondi, da un download di 0,7 MB. Su audio pulito porta l'errore medio di Apple da 113 ms a 45 ms.
Una parola che Align non può migliorare mantiene il tempo di Apple, quindi una correzione può solo aiutare o lasciare la parola com'è. Nove lingue, e una lingua fuori da queste passa con i tempi di Apple intatti.
Cinque volte più preciso.
I tempi per parola di Apple su LibriSpeech test-clean sbagliano in media di 106,4 ms; Align li porta a 20,2 ms, e il 95% delle parole cade entro 50 ms, da un modello di 0,7 MB.
Distanza assoluta media dal confine di parola di riferimento, su un campione di 500 clip per ciascuno split ufficiale di LibriSpeech, senza alcun parlante condiviso tra addestramento e valutazione
| Split | Apple grezzo | Align | Entro 50 ms |
|---|---|---|---|
| test-clean | 106,4 ms | 20,2 ms | 95% |
| test-other | 111,6 ms | 24,8 ms | 92% |
Valutato sui pesi v1.0.0. I riferimenti sono stime di allineamento forzato prodotte da Qwen3-ForcedAligner combinato con un secondo allineatore, non annotazioni umane: i numeri mostrano una riduzione ampia e coerente dell'errore di tempo, non una verità esatta a livello di campione. Fa eccezione il confronto con WhisperX, misurato su 258 confini di parola corretti a mano da una persona sulla forma d'onda.
Casi d'uso
Timestamp per parola precisi per ogni trascrizione.
Sottotitoli parola per parola che stanno al passo
Accendi ogni parola nel momento in cui viene detta in una vista di sottotitoli, in una schermata di testi in stile karaoke o in un'app per imparare le lingue, dalla trascrizione di Apple. I tempi cadono sulla parola invece che un decimo di secondo più in là.
Taglia una clip su una parola
Ritaglia una registrazione fino a una citazione in un editor di podcast o in un'app video e fai partire il taglio da dove parte la parola. Nessun fotogramma della parola precedente, nessuna consonante mozzata, e nessuna correzione manuale sulla timeline.
Evidenzia la parola pronunciata in una trascrizione
Scorri una trascrizione al passo con la riproduzione in un registratore di riunioni o in un'app per le lezioni, con l'evidenziazione che si muove sulla parola invece di scappare avanti rispetto all'audio.
Una ricerca che cade sul momento giusto
Salta al secondo esatto in cui una parola è stata detta in un archivio di registrazioni, sul dispositivo. I tempi sono così precisi che la testina parte sulla parola e non a metà di quella precedente.
Ispirazione
Idee da costruire con Align. Copia un prompt nel tuo coding agent e parti.
Highlight each word as it's spoken, timed to the audio.
Tighten a system transcriber's word timings so captions land on the word.
Build a text-based video editor where selecting words trims the clip.
Add bouncing word-by-word captions to vertical videos.
Make transcript search jump the audio to the exact word.
Cosa fa il modello
- Corregge i tempi a livello di parola che restituiscono
SpeechTranscribereSpeechAnalyzerdi Apple, senza sostituirli: stesse parole, stessa superficie di risultato, valoriaudioTimeRangepiù precisi. - Errore medio da 124,2 ms a 43,9 ms, mediato per macro sulle nove lingue perché nessuna lingua da sola regga il dato. In inglese va oltre: da 106,4 ms a 20,2 ms.
- Su un campione di 500 clip di LibriSpeech test-clean, il 95% delle parole cade entro 50 ms dal riferimento, contro il 37% precedente. Il decimo peggiore migliora di più: da 230,7 ms a 33,0 ms, circa un fotogramma video a 30 fps.
- Un fallback strutturale mantiene il timestamp originale di Apple ogni volta che una correzione sarebbe non valida, tocca il bordo della finestra di ricerca o non ha contesto di streaming.
- Nove lingue: inglese, spagnolo, francese, italiano, portoghese, tedesco, giapponese, coreano e cinese. Le altre lingue passano invariate.
- Circa 0,7 MB di Core ML compilato in due stadi, eseguiti su CPU e Neural Engine; un risultato tipico viene rifinito in pochi millisecondi.
Per iniziare
Aggiungi timestamp per parola alla tua app iOS or macOS or web in poche righe di codice. Documentazione di Align.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let align = Align()
guard try await align.isSupported(languageCode: "en") else { return words }
let fixed = try await align.refine(words, audio: samples, sampleRate: 16_000, languageCode: "en")
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: timestamp per parola on-device per qualsiasi trascrizione. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/align
import { Align } from "@desert-ant-labs/align/native";
const align = await Align.load();
const fixed = await align.refine(samples, 16000, words, { language: "en" });
align.dispose();
Add Align from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: timestamp per parola on-device per qualsiasi trascrizione. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/align Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Specifiche
- Accuratezza
- 20,2 ms di errore medio su LibriSpeech test-clean contro i 106,4 ms di Apple, e 43,9 ms sulle nove lingue contro i 124,2 ms di Apple
- Dimensione sul dispositivo
- Circa 0,7 MB di Core ML compilato (due stadi da 0,3 MB, più il banco di filtri e il calibratore)
- Lingue
- Inglese, spagnolo, francese, italiano, portoghese, tedesco, giapponese, coreano, cinese
- Modello
- Cascata a due stadi, dal grosso al fine, su uno spettrogramma log-mel, con un calibratore a gradient boosting
- Piattaforme
- iOS 26, macOS 26, tvOS 26, visionOS 26 su Core ML, più Linux, Windows e Node su LiteRT
Align corregge i tempi di un trascrittore; non trascrive. Lo StreamingRefiner che si collega a SpeechAnalyzer di Apple richiede iOS 26, macOS 26, tvOS 26 o visionOS 26.
Align.refine, offline, corregge da solo le parole di qualsiasi trascrizione e gira su Linux, Windows e Node tramite LiteRT.
Align non promette di migliorare ogni parola. Il ripiego che mantiene il tempo originale intercetta le correzioni che sembrano rischiose, non tutte quelle sbagliate.
I numeri pronunciati sono il caso più debole: su un campione ridotto la rifinitura ha allontanato i confini delle cifre dal riferimento invece di lasciarli com'erano.
FAQ
Cos'è Align?
Marcature temporali per parola sul dispositivo, per qualsiasi trascrittore. Taglia, sottotitola ed evidenzia con cinque volte più precisione, da 0,7 MB.
Align funziona sul dispositivo?
Sì. Align funziona sul dispositivo, senza chiamate a un server, quindi i dati restano con l'utente.
Quali piattaforme supporta Align?
Align è distribuito come SDK nativo on-device per Swift, JavaScript / TypeScript.
Quanto costa Align?
Ogni modello è gratuito fino a 100k dispositivi attivi mensili. L'inferenza è illimitata. Contattaci per licenze personalizzate.
Quanto è preciso o veloce Align?
I tempi per parola di Apple su LibriSpeech test-clean sbagliano in media di 106,4 ms; Align li porta a 20,2 ms, e il 95% delle parole cade entro 50 ms, da un modello di 0,7 MB.