Uhm: deteção de bordões no dispositivo para áudio e vídeo
Deteção de bordões no dispositivo que encontra «um», «uh», «hmm» e outros bordões diretamente na forma de onda, com precisão de 20 milissegundos.
O Uhm é um classificador de alta resolução temporal que encontra bordões diretamente no áudio, com precisão de 20 milissegundos. O Uhm lê a forma de onda, por isso não é preciso gerar primeiro uma transcrição, que é o custo habitual de encontrar disfluências.
O Uhm foi treinado em inglês e transfere-se acusticamente para espanhol, francês, alemão e neerlandês sem novo treino. Uma transcrição nem sequer ajudaria: modelos como o Whisper deixam os bordões de fora do resultado, por isso nunca aparecem no texto para serem encontrados ou cortados. O Uhm analisa o áudio e deteta-os no dispositivo, sem uploads e sem custo ao minuto.
Demonstração
Desempenho
Analisa áudio a 296x tempo real, no dispositivo, com previsões precisas a 20 ms.
Fator de tempo real (duração do áudio sobre o tempo de análise), Core ML fp16, a quente (interno)
| Dispositivo | Fator de tempo real |
|---|---|
| iPhone 17 Pro | ~296x |
| iPad Pro (M4) | ~279x |
| iPhone 15 Pro | ~169x |
Benchmarks internos. Treinado em inglês; transfere-se acusticamente para espanhol, francês, alemão e neerlandês.
Casos de uso
Edição de podcast e vídeo
Localize cada bordão para cortar ou apertar, sem executar primeiro uma passagem de transcrição.
Limpeza de transcrições
Assinale disfluências de forma acústica para que as transcrições seguintes fiquem limpas.
Sem custo ao minuto
Detete bordões no dispositivo em vez de juntar o WhisperX com regex ou pagar conversão de voz em texto na nuvem ao minuto.
Feedback de oratória
Meça a frequência de bordões em discurso gravado, para ferramentas de treino e de coaching.
O que faz
- Alta resolução temporal: preciso a 20 ms.
- Deteção acústica: funciona diretamente na forma de onda, sem necessidade de transcrição.
- Predefinição
Bias: precisão, equilibrado ou recall. - Treinado em inglês, transfere-se para espanhol, francês, alemão e neerlandês sem novo treino.
Plataformas e instalação
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/uhm-swift", from: "0.1.0")
import Uhm
let result = try await Uhm().analyze(audioURL: url)
for f in result.fillers { print(f.start, f.end, f.type ?? .other) }
Add Uhm from Desert Ant Labs to this project. Deteção de bordões no dispositivo que encontra «um», «uh», «hmm» e outros bordões diretamente na forma de onda, com precisão de 20 milissegundos. SDKs (use the one that matches this project's platform): Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/uhm-swift // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/uhm-swift", from: "0.1.0") Reference: - Model page: https://desertant.com/models/uhm/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK that matches this project's platform, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificações
- Resolução
- Resolução de 20 ms
- Abordagem
- Acústica, sem transcrição
- Línguas
- Inglês, transfere-se para ES, FR, DE, NL
- Privacidade
- Executado no dispositivo; o áudio nunca sai do dispositivo
FAQ
O que é o Uhm?
Deteção de bordões no dispositivo que encontra «um», «uh», «hmm» e outros bordões diretamente na forma de onda, com precisão de 20 milissegundos.
O Uhm é executado no dispositivo?
Sim. O Uhm é executado inteiramente no dispositivo: a inferência acontece localmente, sem qualquer chamada a servidores, por isso os dados nunca saem do dispositivo.
Que plataformas o Uhm suporta?
O Uhm é disponibilizado como SDKs nativos, executados no dispositivo, para Swift.
Quanto custa o Uhm?
Todos os modelos são gratuitos para até 100k dispositivos ativos mensais por SDK. Inferência ilimitada por utilizador. Contacte-nos para licenças personalizadas.
Qual é a precisão ou a rapidez do Uhm?
Analisa áudio a 296x tempo real, no dispositivo, com previsões precisas a 20 ms.