Align
Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque com cinco vezes mais precisão, a partir de 0,7 MB.

Marcações de tempo precisas por palavra para qualquer transcrição.
A Apple diz que «world» vai de 2,61 a 3,04 segundos. O Align diz de 2,57 a 2,98. Corte ali e o corte fica limpo, a legenda acende na palavra, e o destaque começa onde o orador começou.
Você mantém o transcritor da Apple. O Align lê o mesmo áudio que o SpeechAnalyzer já recebe e devolve as mesmas palavras com tempos de início e fim mais justos, em poucos milissegundos, a partir de um download de 0,7 MB. Em áudio limpo, isso reduz o erro médio da Apple de 113 ms para 45 ms.
Uma palavra que o Align não consegue melhorar mantém a marcação da Apple, então uma correção só pode ajudar ou deixar a palavra como está. Nove línguas, e um locale fora deles passa com as marcações da Apple intactas.
Cinco vezes mais preciso.
Os tempos por palavra da Apple no LibriSpeech test-clean erram em média 106,4 ms; o Align reduz isso para 20,2 ms, e 95% das palavras ficam a menos de 50 ms, a partir de um modelo de 0,7 MB.
Distância absoluta média em relação à fronteira de palavra de referência, numa amostra de 500 excertos de cada split oficial do LibriSpeech, sem qualquer falante partilhado entre treino e avaliação
| Split | Apple bruto | Align | Até 50 ms |
|---|---|---|---|
| test-clean | 106,4 ms | 20,2 ms | 95% |
| test-other | 111,6 ms | 24,8 ms | 92% |
Avaliado com os pesos v1.0.0. As referências são estimativas de alinhamento forçado por máquina, do Qwen3-ForcedAligner combinado com um segundo alinhador, e não anotações humanas: os números mostram uma redução grande e consistente do erro de tempo, não uma verdade absoluta ao nível da amostra. A exceção é a comparação com o WhisperX, medida em 258 fronteiras de palavra corrigidas à mão por uma pessoa sobre a forma de onda.
Casos de uso
Marcações de tempo precisas por palavra para qualquer transcrição.
Legendas palavra a palavra que acompanham
Acenda cada palavra conforme ela é dita num ecrã de legendas, num ecrã de letras em estilo karaokê ou num app de aprendizagem de línguas, a partir da transcrição da Apple. As marcações caem na palavra, em vez de a um décimo de segundo dela.
Corte um clipe numa palavra
Recorte uma gravação até uma citação num editor de podcast ou um app de vídeo e faça o corte começar onde a palavra começa. Sem um fotograma da palavra anterior, sem uma consoante cortada e sem ajuste manual na linha do tempo.
Destaque a palavra falada numa transcrição
Role uma transcrição em sincronia com a reprodução num gravador de reuniões ou um app de aulas, com o destaque a avançar na palavra em vez de se adiantar ao áudio.
Busca que cai no momento exato
Salte para o segundo em que uma palavra foi dita num acervo de gravações, no dispositivo. As marcações são precisas o bastante para o cursor de reprodução começar na palavra, e não no meio da anterior.
Inspiração
Ideias para construir com o Align. Copie um prompt para o seu agente de código e comece.
Highlight each word as it's spoken, timed to the audio.
Tighten a system transcriber's word timings so captions land on the word.
Build a text-based video editor where selecting words trims the clip.
Add bouncing word-by-word captions to vertical videos.
Make transcript search jump the audio to the exact word.
O que o modelo faz
- Corrige as marcações no nível da palavra que o
SpeechTranscribere oSpeechAnalyzerda Apple retornam, sem substituí-los: as mesmas palavras, a mesma superfície de resultado, valores deaudioTimeRangemais justos. - Erro médio de tempo de 124,2 ms para 43,9 ms, com média macro entre os nove idiomas, para que nenhum idioma sozinho sustente o número. Em inglês vai mais longe: de 106,4 ms para 20,2 ms.
- Numa amostra de 500 excertos do LibriSpeech test-clean, 95% das palavras ficam a menos de 50 ms da referência, contra 37% antes. O pior décimo é o que mais melhora: de 230,7 ms para 33,0 ms, cerca de um fotograma de vídeo a 30 fps.
- Um fallback estrutural mantém a marcação original da Apple sempre que uma correção seria inválida, atinge o limite da janela de pesquisa ou não tem contexto de streaming.
- Nove línguas: inglês, espanhol, francês, italiano, português, alemão, japonês, coreano e chinês. Os demais locales passam sem alteração.
- Cerca de 0,7 MB de Core ML compilado em dois estágios, executados na CPU e no Neural Engine; um resultado típico é refinado em poucos milissegundos.
Primeiros passos
Adicione marcações de tempo por palavra ao seu app iOS or macOS or web em poucas linhas de código. Docs do Align.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
import Align
let align = Align()
guard try await align.isSupported(languageCode: "en") else { return words }
let fixed = try await align.refine(words, audio: samples, sampleRate: 16_000, languageCode: "en")
Add Align from Desert Ant Labs to this Swift project (iOS, macOS). What it does: marcações de tempo por palavra no dispositivo para qualquer transcrição. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0") // target dependency .product(name: "Align", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
npm i @desert-ant-labs/align
import { Align } from "@desert-ant-labs/align/native";
const align = await Align.load();
const fixed = await align.refine(samples, 16000, words, { language: "en" });
align.dispose();
Add Align from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js). What it does: marcações de tempo por palavra no dispositivo para qualquer transcrição. SDK: JavaScript / TypeScript (Web, Node.js) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme npm i @desert-ant-labs/align Reference: - Model page: https://desertant.com/models/align/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificações
- Exatidão
- 20,2 ms de erro médio no LibriSpeech test-clean contra os 106,4 ms da Apple, e 43,9 ms nos nove idiomas contra os 124,2 ms da Apple
- Tamanho no dispositivo
- Cerca de 0,7 MB de Core ML compilado (dois estágios de 0,3 MB, mais o banco de filtros e o calibrador)
- Línguas
- Inglês, espanhol, francês, italiano, português, alemão, japonês, coreano, chinês
- Modelo
- Cascata de dois estágios, do grosseiro ao fino, sobre um espetrograma log-mel, com um calibrador baseado em gradient boosting
- Plataformas
- iOS 26, macOS 26, tvOS 26, visionOS 26 no Core ML, mais Linux, Windows e Node no LiteRT
O Align corrige os tempos de um transcritor; não transcreve. O StreamingRefiner que se liga ao SpeechAnalyzer da Apple precisa de iOS 26, macOS 26, tvOS 26 ou visionOS 26.
O Align.refine offline corrige as palavras de qualquer transcrição por si só e corre em Linux, Windows e Node através do LiteRT.
O Align não pode prometer melhorar todas as palavras. O mecanismo de segurança que mantém o tempo original apanha as correções que parecem arriscadas, não todas as erradas.
Os números falados são o caso mais fraco: numa amostra pequena, o refinamento afastou as fronteiras dos dígitos da referência, em vez de as deixar como estavam.
FAQ
O que é o Align?
Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque com cinco vezes mais precisão, a partir de 0,7 MB.
O Align é executado no dispositivo?
Sim. O Align é executado no dispositivo, sem qualquer chamada a servidores, por isso os dados ficam com o utilizador.
Que plataformas suporta o Align?
O Align é distribuído como um SDK nativo no dispositivo para Swift, JavaScript / TypeScript.
Quanto custa o Align?
Cada modelo é gratuito para até 100 mil dispositivos ativos mensais. A inferência é ilimitada. Contacte-nos para licenças personalizadas.
Qual é a precisão ou a rapidez do Align?
Os tempos por palavra da Apple no LibriSpeech test-clean erram em média 106,4 ms; o Align reduz isso para 20,2 ms, e 95% das palavras ficam a menos de 50 ms, a partir de um modelo de 0,7 MB.