Uhm
Detección de muletillas en el dispositivo que marca cada eh, em y mmm con una precisión de 20 ms, una hora de audio en 12 s.

Encuentra y elimina todas las muletillas.
Un episodio de una hora se analiza en 12 s en un iPhone 17 Pro. Un catálogo antiguo es un trabajo por lotes que ejecutas en local, no una factura de la nube.
Uhm lo consigue saltándose el paso de la transcripción. La forma habitual de encontrar un «em» es transcribir todo el archivo y buscar en el texto. Una transcripción tampoco ayudaría: modelos como Whisper dejan las muletillas fuera de su salida, así que los «em» nunca aparecen en el texto para encontrarlos.
En su lugar, Uhm lee la forma de onda y marca cada muletilla que oye, así que un editor puede cortarlas o una limpieza con un clic puede ajustar toda la toma. Abre un archivo de audio o vídeo y cada muletilla aparece con su tiempo, así que haces clic en una y saltas justo a ella.
Apple ejecuta la versión Core ML de 45 MB. La demo del navegador y un backend en Python ejecutan el mismo modelo como 51 MB de ONNX, así que un editor web y un trabajo por lotes se comportan igual.
10 minutos de audio en 2 s.
296x en tiempo real en un iPhone 17 Pro, 279x en un iPad Pro M4 y 169x en un iPhone 15 Pro, con una predicción cada 20 ms.

Factor de tiempo real (duración del audio dividida entre el tiempo de análisis), Core ML fp16, en caliente (interno)
| Dispositivo | Factor de tiempo real |
|---|---|
| iPhone 17 Pro | 296x |
| iPad Pro (M4) | 279x |
| iPhone 15 Pro | 169x |
Benchmarks internos. Entrenado en inglés; la transferencia al español, francés, alemán y neerlandés es acústica y no se ha medido por separado.
Casos de uso
Limpia un catálogo antiguo de la noche a la mañana.
Corta todas las muletillas de la línea de tiempo
Marca cada «eh» y cada «em» para que un editor, o una limpieza en un clic, pueda acortar la grabación sin ejecutar antes una pasada de transcripción.
Una línea de tiempo de muletillas en el navegador
En un editor web, cada muletilla de un archivo de audio o vídeo aparece con un tiempo en el que puedes hacer clic para saltar, calculado en el cliente, sin subidas ni una cola de workers por detrás.
Quita los «eh» antes de que lleguen al texto
Marca las disfluencias en el audio y déjalas fuera de las palabras que llegan a tu transcripción, para que el texto final se lea como el hablante quería decir la frase.
Práctica de oratoria y coaching
Mide con qué frecuencia recurre alguien a una muletilla a lo largo de una charla grabada y enséñale el patrón, en una app de práctica que nunca sube su voz.
Inspiración
Ideas para crear con Uhm. Copia un prompt en tu agente de código y adelante.
Add a 'remove ums' button to a podcast or video editor.
Build a speaking coach that counts and marks your filler words.
Show a filler-word timeline for any recording.
A clean, filler-free transcript from a raw, noisy recording.
Trim every filler from a talking-head take automatically.
Qué hace el modelo
- Precisión de trama: exactitud de 20 ms.
- Detección acústica: funciona directamente sobre la forma de onda, sin necesidad de transcripción.
- Preajuste
Bias: precisión, equilibrado o recall. - Entrenado en inglés, se transfiere al español, francés, alemán y neerlandés sin reentrenamiento.
Primeros pasos
Añade detección de muletillas a tu app de iOS or macOS con unas pocas líneas de código. Docs de Uhm.
// Swift Package Manager
.package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.5.0")
// target dependency
.product(name: "Uhm", package: "desert-ant-core")
import Uhm
let result = try await Uhm().analyze(audioURL: url)
for f in result.fillers { print(f.start, f.end, f.type ?? .other) }
Add Uhm from Desert Ant Labs to this Swift project (iOS, macOS). What it does: detección de muletillas en el dispositivo para audio y vídeo. SDK: Swift (iOS, macOS) Repo: https://github.com/Desert-Ant-Labs/desert-ant-core#readme // Swift Package Manager .package(url: "https://github.com/Desert-Ant-Labs/desert-ant-core", from: "3.5.0") // target dependency .product(name: "Uhm", package: "desert-ant-core") Reference: - Model page: https://desertant.com/models/uhm/ - Full catalog and other models: https://desertant.com/llms.txt Add the SDK, then follow its README for the exact API and current version. Do not invent API names or method signatures; confirm them against the README.
Especificaciones
- Resolución
- Resolución de 20 ms
- Modelo
- Acústico, sin transcripción
- Tamaño en el dispositivo
- 45 MB Core ML (Apple); 51 MB ONNX (navegador, servidor)
- Idiomas
- Inglés; se transfiere al español, francés, alemán y neerlandés
- Velocidad
- 296× tiempo real en un iPhone 17 Pro
Uhm se entrenó con inglés, y los cuatro idiomas a los que transfiere no se han medido con datos de referencia por idioma. Uhm funciona mejor con audio de podcasts, reuniones y bustos parlantes.
La música de fondo intensa, las risas o varias personas hablando a la vez le restan precisión. Fíate más de la respuesta de si hay muletilla o no que de la etiqueta: si una muletilla fue un «eh», un «em» o un «mmm» es la parte menos fiable del resultado.
Preguntas frecuentes
¿Qué es Uhm?
Detección de muletillas en el dispositivo que marca cada eh, em y mmm con una precisión de 20 ms, una hora de audio en 12 s.
¿Uhm se ejecuta en el dispositivo?
Sí. Uhm se ejecuta en el dispositivo, sin llamadas a servidor, así que los datos se quedan con el usuario.
¿Qué plataformas admite Uhm?
Uhm se distribuye como un SDK nativo en el dispositivo para Swift.
¿Cuánto cuesta Uhm?
Cada modelo es gratis hasta 100 000 dispositivos activos mensuales. La inferencia es ilimitada. Contáctanos para licencias personalizadas.
¿Qué precisión o velocidad tiene Uhm?
296x en tiempo real en un iPhone 17 Pro, 279x en un iPad Pro M4 y 169x en un iPhone 15 Pro, con una predicción cada 20 ms.