Respuesta rápida: el modelo Whisper de OpenAI en sí no es una aplicación — es una biblioteca de Python que se instala y ejecuta desde la terminal, lo que implica Homebrew, la versión correcta de Python, un entorno virtual, FFmpeg y (a menudo) un montón de errores de dependencias antes de obtener una sola transcripción. Si no quieres tocar código, la vía más rápida hacia esa misma transcripción privada y local es una aplicación de Mac que ya trae Whisper integrado — como Subtitle Studio — que se salta toda la instalación y añade además el preprocesamiento y las herramientas de edición que el Whisper original no tiene.
Si has buscado "cómo ejecutar Whisper en Mac" y has llegado a una guía con seis pasos antes de que el primero siquiera mencione tu archivo de audio real, no te lo estás imaginando. Aquí te explicamos por qué ocurre esto, dónde se atasca la mayoría y cuál es la alternativa sin código.
Qué Es OpenAI Whisper (Y Por Qué No Es Una Aplicación)
Whisper es el modelo de reconocimiento de voz de código abierto de OpenAI, lanzado en 2022 y actualizado desde entonces (large-v3, turbo). Es realmente excelente — preciso en más de 90 idiomas, gratuito y se ejecuta por completo en tu propio ordenador sin subir ningún audio a ningún sitio. Precisamente por eso tanta gente quiere ejecutarlo por su cuenta.
El repositorio de GitHub openai/whisper — 106 mil estrellas, pero es un repositorio de código fuente sin botón de descarga, sin instalador y sin ninguna aplicación que abrir
Fíjate en lo que falta en esa página: un botón de descarga, un instalador, un icono de aplicación. Lo que obtienes es una carpeta con código fuente en Python — 106.000 personas le han dado una estrella al repositorio, pero eso no instala absolutamente nada en tu Mac.
Y es que el repositorio de GitHub es una base de código de investigación, no un producto de consumo. Las instrucciones oficiales de instalación dan por hecho que ya te sientes cómodo:
- Instalando y gestionando distintas versiones de Python
- Usando
pipy entornos virtuales - Leyendo un traceback de Python cuando algo falla
- Instalando una dependencia del sistema (FFmpeg) por separado del propio modelo
Nada de eso es descabellado para un investigador de machine learning. Pero es pedir mucho a alguien que solo quiere subtítulos para un vídeo de YouTube antes de que acabe la noche.
La Forma "Oficial" de Ejecutar Whisper en Mac, Paso a Paso
Para ser justos con el equipo de Whisper, el README está bien redactado. Esto es lo que realmente hace falta para pasar de "no tengo nada instalado" a "tengo una transcripción en pantalla".
Paso 1: Instala Homebrew
Si todavía no tienes el gestor de paquetes no oficial de Apple, esa es la primera instalación:
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
Paso 2: Instala una Versión Compatible de Python
La cadena de dependencias de Whisper (numba, tiktoken, PyTorch) no admite las versiones más recientes de Python. En el momento de escribir esto, Python 3.13 rompe la instalación — necesitas 3.10, 3.11 o 3.12:
brew install python@3.11
Paso 3: Crea un Entorno Virtual
Para evitar que las dependencias de Whisper choquen con cualquier otra cosa de tu sistema, lo recomendado es un entorno aislado:
python3.11 -m venv whisper-env
source whisper-env/bin/activate
Paso 4: Instala FFmpeg
Whisper no decodifica el audio por sí mismo — delega esa tarea en FFmpeg, que hay que instalar aparte:
brew install ffmpeg
Paso 5: Instala Whisper
pip install -U openai-whisper
Paso 6: Ejecuta Tu Primera Transcripción
whisper your-audio.mp3 --model turbo
Seis pasos, tres instaladores independientes, una restricción de versión de Python que ya debías conocer de antemano — y todavía no has transcrito ni una sola palabra. Y esa es la versión en la que nada sale mal.
Dónde Se Atasca Todo el Mundo (Problemas Reales de GitHub y StackOverflow)
Busca problemas de instalación de "openai-whisper" y aparecen una y otra vez los mismos fallos. Estos están citados directamente de reportes reales, sin parafrasear.
"Whisper no se puede usar en Python 3.13"
Si instalas la última versión de Python desde python.org en lugar de fijar una versión anterior con Homebrew, la instalación falla al instante:
Getting requirements to build wheel ... error
KeyError: '__version__'
Como dice claramente una respuesta en el hilo: "Whisper cannot be used on Python 3.13 using only released, supported versions of its dependency chain." (Fuente: StackOverflow) La solución es bajar la versión de Python y reconstruir el entorno virtual desde cero — nada obvio si no sabías de antemano que Whisper es tan sensible a la versión.
"ffmpeg not found" — incluso después de instalar ffmpeg
Este es uno de los errores más comunes de Whisper en Mac, y resulta desconcertante precisamente porque la solución parece que ya debería haber funcionado:
FileNotFoundError: [Errno 2] No such file or directory: 'ffmpeg': 'ffmpeg'
El usuario en este caso ya había ejecutado brew install ffmpeg con éxito, lo había reinstalado, e incluso había probado un wrapper de FFmpeg para Python — el problema real era que el binario de FFmpeg no estaba en el PATH que Python podía ver. (Fuente: StackOverflow) Diagnosticar un problema de PATH requiere saber primero qué es un PATH.
En Mac no hay CUDA — y la mayoría de tutoriales dan por hecho que sí
Casi todas las guías de rendimiento de Whisper hablan de CUDA, el framework de GPU de NVIDIA. Los Mac no tienen GPUs de NVIDIA. Apple Silicon usa en su lugar MPS (Metal Performance Shaders), y el soporte de MPS en PyTorch tiene carencias reales y documentadas:
NotImplementedError: The operator 'aten::isin.Tensor_Tensor_out' is not
currently implemented for the MPS device. ... you can set the environment
variable `PYTORCH_ENABLE_MPS_FALLBACK=1` to use the CPU as a fallback for
this op.
Ese es un error real de un modelo de PyTorch cercano a Whisper, ejecutado en Apple Silicon. (Fuente: GitHub — huggingface/transformers #31408) La solución sugerida hace que esa operación recaiga en la CPU — es decir, un procesamiento más lento para arreglar un fallo que solo existe por el simple hecho de usar un Mac.
Errores del Compilador de Rust Durante la Instalación
Whisper depende del tokenizador tiktoken de OpenAI. Si tu plataforma no tiene disponible una wheel precompilada, pip intenta compilarla desde el código fuente, lo cual requiere un conjunto de herramientas de Rust que probablemente no tengas instalado. El README oficial lo aborda directamente: si la instalación falla con No module named 'setuptools_rust', hay que instalar por separado setuptools-rust, y posiblemente todo el entorno de desarrollo de Rust. Es decir, instalar un conjunto de herramientas de compilación solo para ejecutar un modelo de voz a texto.
Las Opciones "Más Rápidas" Exigen Compilar Desde el Código Fuente
Whisper puro sobre PyTorch va notablemente lento en un Mac, así que el consejo habitual es cambiar a whisper.cpp o mlx-whisper para aprovechar de verdad la velocidad de Apple Silicon. Ambos son más rápidos — pero ambos cambian la configuración de Python por otro tipo de configuración:
git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
./models/download-ggml-model.sh large-v3
./main -m models/ggml-large-v3.bin -f your-audio.wav
Eso implica git, un conjunto de herramientas de compilación de C++, y descargar manualmente archivos de modelo — no es precisamente "sin programar". E incluso después de compilarlo correctamente, las cosas pueden torcerse de formas realmente difíciles de depurar. Un usuario veterano relató que, al procesar un lote de archivos con un binario de whisper.cpp compilado por él mismo en un M4 Mac mini, "funciona perfectamente bien" en un M1, pero en el M4 "simplemente se detiene" al cabo de unas horas sin producir salida, sin ningún error, sin caerse — y la solución fue escribir un script que matara y reiniciara el proceso cada hora. ("Whisper continues running, there are no errors in the terminal, no crashes... there's just no more output.") (Fuente: Ars Technica OpenForum)
Eso no es un error de principiante — es un usuario experimentado que aun así topó con un muro que solo un script y una tarea programada podían sortear.
"El Proceso de Instalación Es Extremadamente Poco Amigable"
Esta queja, presentada como una incidencia de GitHub contra una herramienta basada en Whisper, resume toda la experiencia para quienes no son desarrolladores: "The installer is extremely unfriendly, constantly interrupting the download of large files, resulting in incomplete installation and a missing executable file... For those without programming skills, uninstallation is the only option." (Fuente: GitHub — meizhong986/WhisperJAV #85) La resolución del hilo fue, una vez más, una incompatibilidad de versión de Python — un desconocido guio paso a paso al autor del reporte por la terminal hasta que funcionó.
Incluso Cuando Funciona, los Modelos Grandes Pueden Quedarse Sin Memoria
El modelo large-v3 necesita aproximadamente 10 GB de VRAM/memoria unificada para funcionar con soltura. En un MacBook básico de 8 GB o 16 GB, eso deja el margen tan justo que puede hacer que el proceso se caiga directamente, obligando a bajar a un modelo más pequeño y menos preciso como solución.
Aunque Consigas Que Funcione, Whisper Solo No Son Subtítulos
Supongamos que superas todo lo anterior y consigues un comando whisper your-video.mp4 --model large-v3 que funciona. Lo que obtienes es una transcripción, no subtítulos — y para vídeo, esa es una tarea distinta:
- Sin preprocesamiento. Whisper recibe tu audio en bruto, tal cual. Si hay música de fondo, eco de sala o una introducción ruidosa, el modelo no tiene ni idea de que debe ignorarlo — y está bien documentado que alucina texto (repite frases, inventa diálogos) durante silencios y fondos musicales en lugar de admitir que no está seguro.
- Temporización aproximada. Las marcas de tiempo integradas de Whisper se redondean aproximadamente al segundo más cercano — está bien para una transcripción, pero no para un subtítulo que necesita aparecer justo cuando alguien habla.
- Sin lógica de salto de línea. Los bloques largos y continuos, o los cortes incómodos a mitad de frase, son habituales en la salida en bruto, y no hay ninguna herramienta para arreglarlo más allá de abrir el
.srten un editor de texto. - Sin traducción. Si necesitas una segunda pista de idioma, eso requiere una herramienta y un flujo de trabajo completamente distintos.
- Sin interfaz de edición. Todo ocurre en la línea de comandos. No hay forma de onda, ni arrastrar para ajustar, ni botón de deshacer.
Dicho de otra forma: resolver el problema de instalación no resuelve el problema de los subtítulos. De todos modos vas a necesitar una segunda herramienta para convertir una transcripción en bruto en algo que realmente quieras publicar.
La Forma Más Fácil: Sáltate Python por Completo con Subtitle Studio
Subtitle Studio ejecuta el mismo tipo de modelo Whisper, pero como una aplicación nativa de Mac: la descargas, arrastras tu vídeo y obtienes los subtítulos. Sin terminal, sin versión de Python que gestionar, sin pip install que depurar.
Editor de Subtitle Studio con forma de onda, lista de subtítulos y vista previa de vídeo alineadas con el habla
Esto es lo que obtienes además de la instalación sin terminal:
- Modelo afinado para Apple Silicon. El modelo de transcripción está optimizado específicamente para los chips de la serie M con aceleración Metal — no una compilación genérica de PyTorch que recurre a la CPU para operaciones de MPS no compatibles.
- Preprocesamiento antes de la transcripción. La detección de actividad de voz (VAD) y la reducción de ruido limpian el audio antes de que Whisper lo vea, de modo que la música de fondo y el ruido de sala provocan menos palabras perdidas y menos texto alucinado — precisamente el tipo de fallo por el que el Whisper sin filtrar es conocido.
- Filtrado de alucinaciones. La puntuación de confianza y el análisis de actividad de voz detectan y eliminan el texto fantasma que el modelo inventa durante silencios o música, en lugar de enviarlo directamente a tu archivo de subtítulos.
- Alineación forzada. Tras la transcripción, un alineador forzado vuelve a mapear el texto sobre la forma de onda a nivel de palabra, sustituyendo las marcas de tiempo de Whisper redondeadas a ~1 segundo por una temporización precisa a nivel de fotograma.
- Segmentación basada en PLN. La transcripción en bruto se divide en líneas de subtítulo legibles en los límites naturales de las frases, en lugar de contar caracteres de forma arbitraria.
- Edición integrada. Arrastra para realinear el tiempo de un subtítulo, divide una línea demasiado larga o fusiona fragmentos — sin tener que exportar a un editor de texto.
Herramienta de realineación de Subtitle Studio con un bloque de subtítulo siendo arrastrado para coincidir con la forma de onda del audio
- Traducción en el propio dispositivo. Traduce tus subtítulos terminados a 25 idiomas, completamente sin conexión, sin clave de API y sin coste por palabra — consulta nuestro análisis en profundidad sobre la traducción sin conexión para ver cómo funciona el modelo local.
Panel de traducción de Subtitle Studio con selector de idioma y opciones de proveedor de IA
Tu audio y vídeo nunca salen de tu Mac — la misma garantía de privacidad que ejecutar Whisper tú mismo, sin la instalación.
Subtitle Studio
Pago único. Funciona totalmente sin conexión en tu Mac.
Whisper por Línea de Comandos vs Subtitle Studio — Cara a Cara
| OpenAI Whisper (CLI) | Subtitle Studio | |
|---|---|---|
| Instalación | Homebrew, gestión de versiones de Python, entorno virtual, FFmpeg, pip install | Descarga la aplicación, ábrela |
| Requiere programar | Sí — comandos de terminal, depuración ocasional de dependencias | No |
| Aceleración Apple Silicon | Depende del soporte de MPS en PyTorch (existen carencias) | Integrada, modelo optimizado para Metal |
| Preprocesamiento de audio | Ninguno — el audio en bruto se envía directamente al modelo | VAD + reducción de ruido antes de la transcripción |
| Gestión de alucinaciones | Ninguna — salida directa del modelo | Detectada y filtrada automáticamente |
| Precisión de marcas de tiempo | Granularidad de ~1 segundo | Alineación forzada a nivel de palabra |
| Salto de línea en subtítulos | Ninguno — requiere limpieza manual | Segmentación automática basada en PLN |
| Herramientas de edición | Editor de texto sobre el archivo exportado | Realineación, división y fusión basadas en forma de onda |
| Traducción | No incluida | Integrada, sin conexión, 25 idiomas |
| Formato de salida | .txt, .srt, .vtt | .srt, .fcpxml |
| Coste | Gratis (tu tiempo) | Pago único |
Veredicto
Si eres un desarrollador que quiere integrar Whisper en un pipeline, procesar por lotes miles de archivos o ajustar el modelo tú mismo, la CLI oficial es la herramienta adecuada — esa flexibilidad es exactamente para lo que está hecha, y el coste de configuración es algo que solo pagas una vez.
Si simplemente quieres subtítulos precisos y listos para publicar para un vídeo sin abrir nunca una terminal, la vía sin código te lleva ahí más rápido: la misma tecnología de base, sin ninguna gestión de entornos, y un conjunto de herramientas específicas para subtítulos que el Whisper original nunca fue diseñado para incluir.
Subtitle Studio
Sin Python, sin Homebrew, sin terminal. Solo arrastra tu vídeo.
Preguntas Frecuentes
¿Necesito Saber Python para Ejecutar Whisper en un Mac?
Para usar el paquete oficial openai-whisper, sí — tendrás que instalar Python, gestionar un entorno virtual y ejecutar comandos desde la terminal. Si prefieres no tocar código, aplicaciones como Subtitle Studio ejecutan el mismo tipo de modelo con una interfaz de arrastrar y soltar, sin necesidad de programar.
¿Por Qué Falla la Instalación de Whisper en Mi Mac?
Las causas más habituales son: usar una versión de Python no compatible (actualmente la 3.13 rompe la instalación; usa la 3.10–3.12), que FFmpeg no esté en el PATH del sistema aunque lo hayas instalado, y que falte un compilador de Rust necesario para construir la dependencia tiktoken desde el código fuente. Cada una de estas situaciones produce un mensaje de error distinto y bastante críptico.
¿Whisper Usa la GPU de Mi Mac?
Puede hacerlo, mediante el backend MPS (Metal Performance Shaders) de Apple dentro de PyTorch, pero el soporte de MPS para las operaciones de Whisper tiene carencias documentadas — algunos operadores no están implementados y recurren silenciosamente a una ejecución más lenta en la CPU. whisper.cpp y mlx-whisper suelen aprovechar Apple Silicon de forma más eficiente que el paquete original en Python, pero ambos requieren compilar desde el código fuente.
¿Cuál Es la Diferencia Entre openai-whisper, whisper.cpp y mlx-whisper?
openai-whisper es el paquete original de Python de OpenAI — el más fácil de instalar con pip, pero más lento en Apple Silicon porque pasa por el backend MPS de PyTorch. whisper.cpp es una reimplementación en C++ que usa Metal directamente y es notablemente más rápida, pero hay que clonar el repositorio y compilarlo uno mismo. mlx-whisper usa el framework MLX propio de Apple y suele ser la opción más rápida en chips de la serie M, con una configuración similar desde el código fuente. Ninguno de los tres incluye preprocesamiento de audio, edición de subtítulos ni traducción — son motores de transcripción, no herramientas de subtitulado.
¿Hay Alguna Forma Gratuita de Ejecutar Whisper en Mac Sin Programar?
El modelo Whisper en sí es gratuito y de código abierto, pero ejecutarlo sin ninguna instalación requiere una aplicación empaquetada en lugar de la biblioteca de Python en bruto — alguien tiene que encargarse de la instalación, la gestión del modelo y la interfaz por ti. Subtitle Studio es una aplicación de Mac creada precisamente para esto: sin terminal, sin dependencias que gestionar, pago único en lugar de suscripción.
¿Subtitle Studio Usa el Mismo Modelo Whisper Que la Línea de Comandos?
Subtitle Studio usa un modelo Whisper optimizado y afinado, construido para el tipo de audio mixto con el que realmente trabajan los creadores de vídeo — diálogos sobre música, ruido de sala y habla multilingüe — combinado con aceleración para Apple Silicon. Viene envuelto en un pipeline completo (preprocesamiento, filtrado de alucinaciones, alineación forzada, segmentación por PLN) en lugar del modelo independiente que obtendrías con pip install openai-whisper. Consulta nuestra comparativa entre MacWhisper y Subtitle Studio para ver con más detalle cómo afecta ese pipeline al resultado real.
Prueba Subtitle Studio gratis
Pago único. Sin suscripción. Completamente offline en tu Mac.

