Desert Ant Labs

Align

Marcações de tempo por palavraDisponível

Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque com cinco vezes mais precisão, a partir de 0,7 MB.

Marcações de tempo precisas por palavra para qualquer transcrição.

A Apple diz que «world» vai de 2,61 a 3,04 segundos. O Align diz de 2,57 a 2,98. Corte ali e o corte fica limpo, a legenda acende na palavra, e o destaque começa onde o orador começou.

Você mantém o transcritor da Apple. O Align lê o mesmo áudio que o SpeechAnalyzer já recebe e devolve as mesmas palavras com tempos de início e fim mais justos, em poucos milissegundos, a partir de um download de 0,7 MB. Em áudio limpo, isso reduz o erro médio da Apple de 113 ms para 45 ms.

Uma palavra que o Align não consegue melhorar mantém a marcação da Apple, então uma correção só pode ajudar ou deixar a palavra como está. Nove línguas, e um locale fora deles passa com as marcações da Apple intactas.

Cinco vezes mais preciso.

Os tempos por palavra da Apple no LibriSpeech test-clean erram em média 106,4 ms; o Align reduz isso para 20,2 ms, e 95% das palavras ficam a menos de 50 ms, a partir de um modelo de 0,7 MB.

20,2 ms
Erro médio, LibriSpeech test-clean
Apple sem correção: 106,4 ms
5x
Mais preciso
de 106,4 ms para 20,2 ms
45,0 ms
Contra fronteiras corrigidas à mão
WhisperX: 53,5 ms
0,7 MB
No dispositivo
Core ML compilado, dois estágios

Distância absoluta média em relação à fronteira de palavra de referência, numa amostra de 500 excertos de cada split oficial do LibriSpeech, sem qualquer falante partilhado entre treino e avaliação

SplitApple brutoAlignAté 50 ms
test-clean106,4 ms20,2 ms95%
test-other111,6 ms24,8 ms92%

Avaliado com os pesos v1.0.0. As referências são estimativas de alinhamento forçado por máquina, do Qwen3-ForcedAligner combinado com um segundo alinhador, e não anotações humanas: os números mostram uma redução grande e consistente do erro de tempo, não uma verdade absoluta ao nível da amostra. A exceção é a comparação com o WhisperX, medida em 258 fronteiras de palavra corrigidas à mão por uma pessoa sobre a forma de onda.

Casos de uso

Marcações de tempo precisas por palavra para qualquer transcrição.

Legendas palavra a palavra que acompanham

Acenda cada palavra conforme ela é dita num ecrã de legendas, num ecrã de letras em estilo karaokê ou num app de aprendizagem de línguas, a partir da transcrição da Apple. As marcações caem na palavra, em vez de a um décimo de segundo dela.

Corte um clipe numa palavra

Recorte uma gravação até uma citação num editor de podcast ou um app de vídeo e faça o corte começar onde a palavra começa. Sem um fotograma da palavra anterior, sem uma consoante cortada e sem ajuste manual na linha do tempo.

Destaque a palavra falada numa transcrição

Role uma transcrição em sincronia com a reprodução num gravador de reuniões ou um app de aulas, com o destaque a avançar na palavra em vez de se adiantar ao áudio.

Busca que cai no momento exato

Salte para o segundo em que uma palavra foi dita num acervo de gravações, no dispositivo. As marcações são precisas o bastante para o cursor de reprodução começar na palavra, e não no meio da anterior.

Inspiração

Ideias para construir com o Align. Copie um prompt para o seu agente de código e comece.

Align

Highlight each word as it's spoken, timed to the audio.

Copiar prompt
Align

Tighten a system transcriber's word timings so captions land on the word.

Copiar prompt
Align

Build a text-based video editor where selecting words trims the clip.

Copiar prompt
Align

Add bouncing word-by-word captions to vertical videos.

Copiar prompt
Align

Make transcript search jump the audio to the exact word.

Copiar prompt

O que o modelo faz

  • Corrige as marcações no nível da palavra que o SpeechTranscriber e o SpeechAnalyzer da Apple retornam, sem substituí-los: as mesmas palavras, a mesma superfície de resultado, valores de audioTimeRange mais justos.
  • Erro médio de tempo de 124,2 ms para 43,9 ms, com média macro entre os nove idiomas, para que nenhum idioma sozinho sustente o número. Em inglês vai mais longe: de 106,4 ms para 20,2 ms.
  • Numa amostra de 500 excertos do LibriSpeech test-clean, 95% das palavras ficam a menos de 50 ms da referência, contra 37% antes. O pior décimo é o que mais melhora: de 230,7 ms para 33,0 ms, cerca de um fotograma de vídeo a 30 fps.
  • Um fallback estrutural mantém a marcação original da Apple sempre que uma correção seria inválida, atinge o limite da janela de pesquisa ou não tem contexto de streaming.
  • Nove línguas: inglês, espanhol, francês, italiano, português, alemão, japonês, coreano e chinês. Os demais locales passam sem alteração.
  • Cerca de 0,7 MB de Core ML compilado em dois estágios, executados na CPU e no Neural Engine; um resultado típico é refinado em poucos milissegundos.

Primeiros passos

Adicione marcações de tempo por palavra ao seu app iOS or macOS or web em poucas linhas de código. Docs do Align.

iOS, macOS
Instalação
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")
Exemplo - Swift
import Align

let align = Align()
guard try await align.isSupported(languageCode: "en") else { return words }
let fixed = try await align.refine(words, audio: samples, sampleRate: 16_000, languageCode: "en")
Crie com um prompt
Add Align from Desert Ant Labs to this Swift project (iOS, macOS).

What it does: marcações de tempo por palavra no dispositivo para qualquer transcrição.

SDK:

Swift (iOS, macOS)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core.git", from: "3.5.0")
// target dependency
.product(name: "Align", package: "desert-ant-core")

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
AndroidEm breve
Web, Node.js
Instalação
npm i @desert-ant-labs/align
Exemplo - TypeScript
import { Align } from "@desert-ant-labs/align/native";

const align = await Align.load();
const fixed = await align.refine(samples, 16000, words, { language: "en" });
align.dispose();
Crie com um prompt
Add Align from Desert Ant Labs to this JavaScript / TypeScript project (Web, Node.js).

What it does: marcações de tempo por palavra no dispositivo para qualquer transcrição.

SDK:

JavaScript / TypeScript (Web, Node.js)
Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme
npm i @desert-ant-labs/align

Reference:
- Model page: https://desertant.com/models/align/
- Full catalog and other models: https://desertant.com/llms.txt

Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.

Especificações

Exatidão
20,2 ms de erro médio no LibriSpeech test-clean contra os 106,4 ms da Apple, e 43,9 ms nos nove idiomas contra os 124,2 ms da Apple
Tamanho no dispositivo
Cerca de 0,7 MB de Core ML compilado (dois estágios de 0,3 MB, mais o banco de filtros e o calibrador)
Línguas
Inglês, espanhol, francês, italiano, português, alemão, japonês, coreano, chinês
Modelo
Cascata de dois estágios, do grosseiro ao fino, sobre um espetrograma log-mel, com um calibrador baseado em gradient boosting
Plataformas
iOS 26, macOS 26, tvOS 26, visionOS 26 no Core ML, mais Linux, Windows e Node no LiteRT

O Align corrige os tempos de um transcritor; não transcreve. O StreamingRefiner que se liga ao SpeechAnalyzer da Apple precisa de iOS 26, macOS 26, tvOS 26 ou visionOS 26.

O Align.refine offline corrige as palavras de qualquer transcrição por si só e corre em Linux, Windows e Node através do LiteRT.

O Align não pode prometer melhorar todas as palavras. O mecanismo de segurança que mantém o tempo original apanha as correções que parecem arriscadas, não todas as erradas.

Os números falados são o caso mais fraco: numa amostra pequena, o refinamento afastou as fronteiras dos dígitos da referência, em vez de as deixar como estavam.

FAQ

O que é o Align?

Marcações de tempo por palavra no dispositivo, para qualquer transcritor. Corte, legende e destaque com cinco vezes mais precisão, a partir de 0,7 MB.

O Align é executado no dispositivo?

Sim. O Align é executado no dispositivo, sem qualquer chamada a servidores, por isso os dados ficam com o utilizador.

Que plataformas suporta o Align?

O Align é distribuído como um SDK nativo no dispositivo para Swift, JavaScript / TypeScript.

Quanto custa o Align?

Cada modelo é gratuito para até 100 mil dispositivos ativos mensais. A inferência é ilimitada. Contacte-nos para licenças personalizadas.

Qual é a precisão ou a rapidez do Align?

Os tempos por palavra da Apple no LibriSpeech test-clean erram em média 106,4 ms; o Align reduz isso para 20,2 ms, e 95% das palavras ficam a menos de 50 ms, a partir de um modelo de 0,7 MB.

Recursos