¿Qué es Whisper Web?
Whisper Web es una herramienta de reconocimiento de voz basada en navegador que utiliza el modelo OpenAI Whisper para transcribir audio en más de 100 idiomas directamente en tu dispositivo. No requiere instalación, registro ni envío de datos a servidores externos. Funciona con aceleración WebGPU y WebAssembly, lo que permite procesar archivos de hasta 200 MB o 20 minutos en modo gratuito local. Para archivos más largos (hasta 10 horas / 5 GB) y procesamiento en la nube con prioridad, existe un plan Unlimited por 10 USD al mes (facturación anual). Es ideal para periodistas, estudiantes, creadores de contenido y desarrolladores que necesitan transcripciones rápidas y privadas sin depender de conexión a internet (una vez descargado el modelo inicial).
¿Cuáles son las características de Whisper Web?
- Transcripción local 100% privada: Todo el procesamiento de audio ocurre en tu navegador usando WebGPU. Los archivos de audio nunca salen de tu dispositivo en el modo Free. Salida en formatos TXT, SRT, VTT y JSON.
- Soporte para más de 100 idiomas con detección automática: El modelo detecta el idioma hablado sin necesidad de selección manual. Cubre inglés, español, chino, francés, alemán, japonés, entre otros.
- Tres métodos de entrada de audio: Puedes transcribir desde micrófono en vivo, subir un archivo de audio, o proporcionar una URL de audio/video del navegador.
- Aceleración WebGPU 3-5 veces más rápida: Aprovecha la GPU de tu dispositivo para procesar transcripciones de forma más rápida que la CPU sola, sin necesidad de instalar nada.
- Modo offline disponible (Free): Una vez descargado el modelo en la primera visita, el plan gratuito funciona completamente sin conexión a internet. El plan Unlimited requiere conexión para procesamiento en la nube.
- Plan Unlimited con procesamiento en la nube: Permite archivos de hasta 10 horas / 5 GB, subir hasta 50 archivos a la vez, sincronizar transcripciones entre dispositivos y prioridad en la cola de procesamiento. Precio: 10 USD/mes (facturación anual) o 20 USD/mes (mensual).
- Sin necesidad de cuenta ni API keys: El plan gratuito se puede usar inmediatamente sin registro. Solo abres la página y comienzas.
¿Cuáles son los casos de uso de Whisper Web?
- Periodista transcribiendo entrevistas: Sube un archivo MP3 de 15 minutos de una entrevista en español, obtén la transcripción en SRT para subtitular un video o en TXT para citar textualmente.
- Estudiante grabando una conferencia: Usa el micrófono en vivo durante una clase de 50 minutos, el modelo detecta automáticamente el idioma (inglés, francés, etc.) y exporta a JSON para análisis posterior.
- Creador de contenido generando subtítulos: Sube un video de YouTube (usando la URL) y genera subtítulos en VTT para publicar en redes sociales o en la plataforma de video.
- Investigador analizando entrevistas cualitativas: Transcribe varias entrevistas de hasta 20 minutos cada una en modo local, sin subir datos sensibles a ningún servidor.
- Podcaster editando episodios: Usa el plan Unlimited para subir un episodio de 2 horas (menos de 5 GB) y obtener transcripción completa con marcas de tiempo en SRT.
- Desarrollador probando integración con Whisper: Utiliza la API de salida JSON para alimentar un flujo de procesamiento de lenguaje natural, todo dentro del navegador sin dependencias externas.
¿Cómo usar Whisper Web?
- Abre el sitio web: Visita la página de Whisper Web (sin instalar nada). En la primera carga, el modelo se descargará automáticamente en tu navegador (puede tardar unos segundos dependiendo de la conexión).
- Selecciona el método de entrada: Elige entre "From URL" (pega un enlace de audio/video), "From file" (sube un archivo de hasta 200 MB / 20 min en Free) o "Record" (usa el micrófono en tiempo real).
- Inicia la transcripción: Haz clic en el botón correspondiente. Verás el progreso de procesamiento local (Free) o en la nube (Unlimited). No cierres la pestaña hasta que termine.
- Revisa y exporta: Una vez completada la transcripción, puedes visualizar el texto en pantalla. Elige el formato de exportación: TXT (texto plano), SRT (subtítulos), VTT (subtítulos web) o JSON (datos estructurados).
- Para uso offline: Después de la primera descarga del modelo, puedes usar el plan Free sin conexión a internet. Si necesitas archivos más largos, cambia al plan Unlimited (requiere conexión).









