Modelos de audio en el dispositivo
Modelos pequeños para la voz, en el dispositivo: sonido de estudio, muletillas eliminadas, el idioma identificado, quién dijo qué. Nada se sube a la nube.
Todos los modelos de audio se ejecutan en el chip que ya lleva el teléfono, así que una grabación de cinco minutos se procesa en segundos y el audio nunca sale del dispositivo. Sin facturación por minuto, sin subidas, sin colas.
Modelos disponibles
Mejora de voz en el dispositivo que da a tu grabación el sonido cálido y de micrófono cercano de un estudio de podcast, procesada 100% en el dispositivo.
Detección de muletillas en el dispositivo que marca cada eh, em y mmm con una precisión de 20 ms, una hora de audio en 12 s.
Marcas de tiempo por palabra en el dispositivo, para cualquier transcriptor. Corta, subtitula y resalta con cinco veces más precisión, desde 0,7 MB.
Un modelo rápido de selección de clips que convierte una grabación larga en shorts y destacados ordenados, a partir de una transcripción. En iPhone o Mac.
Identificación del idioma hablado en el dispositivo en 99 idiomas, a partir de un fragmento corto de audio, antes de que empiece la transcripción.
Transcribe 10 minutos de audio en 2 s en un iPhone, 14x más rápido que Whisper, con marcas de tiempo precisas por palabra.
Disponibles próximamente
Precios
Cada modelo es gratis hasta 100 000 dispositivos activos mensuales. La inferencia es ilimitada.