Resposta ràpida: el model Whisper d'OpenAI no és una aplicació — és una biblioteca de Python que s'instal·la i s'executa des del terminal, cosa que implica Homebrew, la versió correcta de Python, un entorn virtual, FFmpeg i (sovint) un munt d'errors de dependències abans d'obtenir la primera transcripció. Si no vols tocar codi, la via més ràpida cap a la mateixa transcripció privada i local és una aplicació de Mac que ja porta Whisper integrat — com Subtitle Studio — que s'estalvia tota la instal·lació i hi afegeix el preprocessament i les eines d'edició que el Whisper original no té.
Si has buscat "com executar Whisper al Mac" i has trobat una guia amb sis passos abans que el primer pas ni tan sols mencioni el teu fitxer d'àudio, no t'ho estàs imaginant. Aquí t'expliquem per què passa, on s'encalla tothom i quina és l'alternativa sense codi.
Què És l'OpenAI Whisper (I Per Què No És Una Aplicació)
Whisper és el model de reconeixement de veu de codi obert d'OpenAI, llançat el 2022 i actualitzat des de llavors (large-v3, turbo). És realment excel·lent — precís en més de 90 idiomes, gratuït i funciona íntegrament al teu propi ordinador, sense pujar cap àudio enlloc. Precisament per això tanta gent el vol executar pel seu compte.
El repositori de GitHub openai/whisper — 106 mil estrelles, però un repositori de codi font sense botó de descàrrega, sense instal·lador i sense cap aplicació per obrir
Fixa't en el que hi falta a aquesta pàgina: un botó de descàrrega, un instal·lador, una icona d'aplicació. El que hi trobes és una carpeta de codi font en Python — 106.000 persones han posat una estrella al repositori, però fer-ho no instal·la res al teu Mac.
El repositori de GitHub és una base de codi de recerca, no un producte de consum. Les instruccions oficials d'instal·lació donen per fet que ja et sents còmode amb:
- Instal·lar i gestionar diverses versions de Python
- Fer servir
pipi entorns virtuals - Llegir un traceback de Python quan alguna cosa falla
- Instal·lar una dependència del sistema (FFmpeg) a banda del model
Res d'això és desmesurat per a algú que investiga en aprenentatge automàtic. Però és molt demanar a algú que només vol subtítols per a un vídeo de YouTube abans que arribi la nit.
La Via "Oficial" Per Executar Whisper al Mac, Pas a Pas
Per ser justos amb l'equip de Whisper, el README està ben escrit. Això és el que realment cal fer per passar de "res instal·lat" a "una transcripció a la pantalla".
Pas 1: Instal·la Homebrew
Si encara no tens el gestor de paquets no oficial d'Apple, aquesta és la primera instal·lació:
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
Pas 2: Instal·la una versió compatible de Python
La cadena de dependències de Whisper (numba, tiktoken, PyTorch) no admet les versions més noves de Python. A hores d'ara, Python 3.13 trenca la instal·lació — cal la 3.10, la 3.11 o la 3.12:
brew install python@3.11
Pas 3: Crea un entorn virtual
Per evitar que les dependències de Whisper xoquin amb qualsevol altra cosa del sistema, l'enfocament recomanat és un entorn aïllat:
python3.11 -m venv whisper-env
source whisper-env/bin/activate
Pas 4: Instal·la FFmpeg
Whisper no descodifica l'àudio pel seu compte — delega la feina a FFmpeg, que cal instal·lar per separat:
brew install ffmpeg
Pas 5: Instal·la Whisper
pip install -U openai-whisper
Pas 6: Executa la teva primera transcripció
whisper your-audio.mp3 --model turbo
Sis passos, tres instal·ladors independents, una restricció de versió de Python que ja havies de conèixer d'entrada — i encara no has transcrit ni una sola paraula. I això és la versió en què no falla res.
On S'Encalla Tothom (Casos Reals de GitHub i StackOverflow)
Cerca problemes d'instal·lació d'"openai-whisper" i sempre apareixen els mateixos fracassos. Aquests són citats directament de comentaris reals, no parafrasejats.
"Whisper no es pot fer servir a Python 3.13"
Si instal·les la darrera versió de Python des de python.org en lloc de fixar-ne una d'anterior amb Homebrew, la instal·lació falla a l'instant:
Getting requirements to build wheel ... error
KeyError: '__version__'
Com diu clarament una resposta al fil: "Whisper cannot be used on Python 3.13 using only released, supported versions of its dependency chain." (Font: StackOverflow) La solució és baixar de versió el Python i reconstruir l'entorn virtual des de zero — gens evident si no saps ja que Whisper és sensible a la versió.
"ffmpeg not found" — fins i tot després d'instal·lar ffmpeg
Aquest és un dels errors de Whisper més habituals al Mac, i confon precisament perquè sembla que la solució ja s'hauria d'haver aplicat:
FileNotFoundError: [Errno 2] No such file or directory: 'ffmpeg': 'ffmpeg'
La persona d'aquest cas ja havia executat brew install ffmpeg amb èxit, l'havia reinstal·lat, i fins i tot havia provat un embolcall de FFmpeg per a Python — el problema real era que el binari de FFmpeg no era al PATH que Python podia veure. (Font: StackOverflow) Diagnosticar un problema de PATH requereix saber què és un PATH.
Al Mac no hi ha CUDA — i la majoria de tutorials donen per fet que sí
Gairebé cada guia de rendiment de Whisper parla de CUDA, el framework de GPU de NVIDIA. Els Mac no tenen GPUs de NVIDIA. L'Apple Silicon fa servir MPS (Metal Performance Shaders) en lloc seu, i el suport de MPS a PyTorch té buits reals i documentats:
NotImplementedError: The operator 'aten::isin.Tensor_Tensor_out' is not
currently implemented for the MPS device. ... you can set the environment
variable `PYTORCH_ENABLE_MPS_FALLBACK=1` to use the CPU as a fallback for
this op.
Aquest és un error real d'un model de PyTorch proper a Whisper, executat en Apple Silicon. (Font: GitHub — huggingface/transformers #31408) La solució suggerida fa recórrer aquella operació a la CPU — és a dir, un processament més lent per arreglar un error que només existeix pel simple fet de fer servir un Mac.
Errors del compilador de Rust durant la instal·lació
Whisper depèn del tokenitzador tiktoken d'OpenAI. Si la teva plataforma no té una wheel precompilada disponible, pip intenta compilar-lo des del codi font, cosa que requereix un conjunt d'eines de Rust que segurament no tens instal·lat. El README oficial ho aborda directament: si la instal·lació falla amb No module named 'setuptools_rust', cal instal·lar per separat setuptools-rust, i possiblement tot l'entorn de desenvolupament de Rust. És a dir, instal·lar un conjunt d'eines de compilació només per executar un model de veu a text.
Les opcions "més ràpides" exigeixen compilar des del codi font
Whisper pur sobre PyTorch va notablement lent en un Mac, així que el consell habitual és canviar a whisper.cpp o mlx-whisper per aprofitar de debò la velocitat de l'Apple Silicon. Tots dos són més ràpids — però tots dos canvien la configuració de Python per un altre tipus de configuració:
git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
./models/download-ggml-model.sh large-v3
./main -m models/ggml-large-v3.bin -f your-audio.wav
Això és git, un conjunt d'eines de compilació de C++, i descarregar manualment fitxers de model — no és exactament "sense programar". I fins i tot després de compilar-ho correctament, les coses poden torçar-se de maneres genuïnament difícils de depurar. Un usuari veterà va explicar que processava un lot de fitxers amb un binari de whisper.cpp compilat per ell mateix en un M4 Mac mini: "funciona perfectament bé" en un M1, però en l'M4 "simplement s'atura" i deixa de produir sortida al cap d'unes hores, sense cap error, sense cap fallada — i la solució va ser escriure un script per matar i reiniciar el procés cada hora. ("Whisper continues running, there are no errors in the terminal, no crashes... there's just no more output.") (Font: Ars Technica OpenForum)
Això no és un error de principiant — és un usuari experimentat que encara va topar amb un mur que només un script i una tasca programada podien resoldre.
"El procés d'instal·lació és extremadament poc amigable"
Aquesta queixa, presentada com a incidència de GitHub contra una eina basada en Whisper, resumeix tota l'experiència per a qui no és desenvolupador: "The installer is extremely unfriendly, constantly interrupting the download of large files, resulting in incomplete installation and a missing executable file... For those without programming skills, uninstallation is the only option." (Font: GitHub — meizhong986/WhisperJAV #85) La resolució del fil va tornar a ser, un cop més, una incompatibilitat de versió de Python — un desconegut va guiar pas a pas l'usuari pel terminal fins que va funcionar.
Fins i tot quan funciona, els models grans es poden quedar sense memòria
El model large-v3 necessita aproximadament 10 GB de VRAM/memòria unificada per funcionar amb comoditat. En un MacBook bàsic de 8 GB o 16 GB, això és just el suficient per fer que el procés falli directament, i obliga a baixar a un model més petit i menys precís com a solució.
Encara Que Funcioni, Whisper Sol No Són Subtítols
Suposem que superes tot això i aconsegueixes que la comanda whisper your-video.mp4 --model large-v3 funcioni. El que obtens és una transcripció, no subtítols — i per a vídeo, això és una feina diferent:
- Sense preprocessament. Whisper rep el teu àudio en brut, tal com és. Si hi ha música de fons, ressò de sala o una introducció sorollosa, el model no té ni idea que ho ha d'ignorar — i està ben documentat que al·lucina text (repeteix frases, inventa diàlegs) durant silencis i fons musicals en lloc d'admetre que no n'està segur.
- Cronometratge aproximat. Les marques de temps integrades de Whisper s'arrodoneixen aproximadament al segon més proper — bé per a una transcripció, no per a un subtítol que ha d'aparèixer exactament quan algú parla.
- Sense lògica de salt de línia. Els blocs llargs i continus, o els talls incòmodes a mig frase, són habituals en la sortida en brut, i no hi ha cap eina per arreglar-ho més enllà d'obrir el
.srten un editor de text. - Sense traducció. Si necessites una pista en un segon idioma, això és una eina i un flux de treball completament diferents.
- Sense interfície d'edició. Tot passa a la línia de comandes. No hi ha forma d'ona, ni arrossegar per ajustar, ni botó de desfer.
Dit d'una altra manera: resoldre el problema d'instal·lació no resol el problema dels subtítols. Encara necessitaràs una segona eina per convertir una transcripció en brut en alguna cosa que realment vulguis publicar.
La Manera Més Fàcil: Salta't Python del Tot amb Subtitle Studio
Subtitle Studio executa la mateixa mena de model de Whisper, però com una aplicació nativa de Mac: la descarregues, hi arrossegues el vídeo, i n'obtens els subtítols. Sense terminal, sense versió de Python a gestionar, sense pip install per depurar.
Editor de Subtitle Studio amb forma d'ona, llista de subtítols i previsualització de vídeo alineats amb la parla
Això és el que obtens a més de la instal·lació sense terminal:
- Model ajustat per a l'Apple Silicon. El model de transcripció està optimitzat específicament per als xips de la sèrie M amb acceleració de Metal — no una compilació genèrica de PyTorch que recorre a la CPU per a operacions de MPS no compatibles.
- Preprocessament abans de la transcripció. La detecció d'activitat de veu (VAD) i la reducció de soroll netegen l'àudio abans que Whisper el vegi, de manera que la música de fons i el soroll de sala provoquen menys paraules perdudes i menys text al·lucinat — exactament el mode de fallada pel qual Whisper sense filtrar és conegut.
- Filtratge d'al·lucinacions. La puntuació de confiança i l'anàlisi d'activitat de veu detecten i eliminen el text fantasma que el model inventa durant silencis o música, en lloc d'enviar-lo directament al teu fitxer de subtítols.
- Alineació forçada. Després de la transcripció, un alineador forçat torna a mapar el text sobre la forma d'ona a nivell de paraula, substituint les marques de temps arrodonides a ~1 segon de Whisper per un cronometratge precís a nivell de fotograma.
- Segmentació basada en NLP. La transcripció en brut es divideix en línies de subtítol llegibles en els límits naturals de les frases, en lloc de comptar caràcters de manera arbitrària.
- Edició integrada. Arrossega per realinear el temps d'un subtítol, divideix una línia massa llarga o fusiona fragments — sense haver d'exportar a un editor de text.
Eina de realineació de Subtitle Studio amb un bloc de subtítol arrossegat perquè coincideixi amb la forma d'ona de l'àudio
- Traducció en local. Tradueix els subtítols acabats a 25 idiomes, completament fora de línia, sense clau d'API i sense cost per paraula — consulta el nostre article sobre la traducció fora de línia per veure com funciona el model local.
Panell de traducció de Subtitle Studio amb selector d'idioma i opcions de proveïdor d'IA
El teu àudio i vídeo mai no surten del teu Mac — la mateixa garantia de privacitat que executar Whisper tu mateix, sense la configuració.
Subtitle Studio
Pagament únic. Funciona totalment fora de línia al teu Mac.
Whisper per Línia de Comandes vs Subtitle Studio — Costat a Costat
| OpenAI Whisper (CLI) | Subtitle Studio | |
|---|---|---|
| Configuració | Homebrew, gestió de versions de Python, entorn virtual, FFmpeg, pip install | Descarrega l'aplicació, obre-la |
| Cal programar | Sí — comandes de terminal, depuració ocasional de dependències | No |
| Acceleració Apple Silicon | Depèn del suport de MPS a PyTorch (hi ha buits) | Model integrat, optimitzat per a Metal |
| Preprocessament d'àudio | Cap — l'àudio en brut s'envia directament al model | VAD + reducció de soroll abans de la transcripció |
| Gestió d'al·lucinacions | Cap — sortida directa del model | Detectada i filtrada automàticament |
| Precisió de les marques de temps | Granularitat d'~1 segon | Alineació forçada a nivell de paraula |
| Salt de línia dels subtítols | Cap — cal netejar manualment | Segmentació automàtica basada en NLP |
| Eines d'edició | Editor de text sobre el fitxer exportat | Realineació, divisió i fusió basades en forma d'ona |
| Traducció | No inclosa | Integrada, fora de línia, 25 idiomes |
| Format de sortida | .txt, .srt, .vtt | .srt, .fcpxml |
| Cost | Gratuït (el teu temps) | Pagament únic |
Veredicte
Si ets un desenvolupador que vol integrar Whisper en un pipeline automatitzat, processar per lots milers de fitxers, o ajustar el model tu mateix, la CLI oficial és l'eina adequada — aquesta flexibilitat és exactament per a què està feta, i el cost de la configuració és quelcom que només pagues una vegada.
Si només vols subtítols precisos i llestos per publicar per a un vídeo sense obrir mai un terminal, la via sense codi t'hi porta més ràpid: la mateixa tecnologia de base, sense cap gestió d'entorns, i amb un conjunt d'eines específiques per a subtítols que Whisper original mai va ser dissenyat per incloure.
Subtitle Studio
Sense Python, sense Homebrew, sense terminal. Només arrossega el teu vídeo.
Preguntes Freqüents
Necessito saber Python per executar Whisper en un Mac?
Per fer servir el paquet oficial openai-whisper, sí — hauràs d'instal·lar Python, gestionar un entorn virtual i executar comandes des del terminal. Si prefereixes no tocar codi, aplicacions com Subtitle Studio executen el mateix tipus de model amb una interfície d'arrossegar i deixar anar, sense necessitat de programar.
Per què falla la instal·lació de Whisper al meu Mac?
Les causes més habituals són: fer servir una versió de Python no compatible (actualment la 3.13 trenca la instal·lació; cal fer servir la 3.10–3.12), que FFmpeg no estigui al PATH del sistema encara que l'hagis instal·lat, i que falti un compilador de Rust necessari per construir la dependència tiktoken des del codi font. Cadascuna d'aquestes situacions produeix un missatge d'error diferent i força críptic.
Whisper fa servir la GPU del meu Mac?
Pot fer-ho, mitjançant el backend MPS (Metal Performance Shaders) d'Apple dins de PyTorch, però el suport de MPS per a les operacions de Whisper té buits documentats — alguns operadors no estan implementats i recorren silenciosament a una execució més lenta a la CPU. whisper.cpp i mlx-whisper generalment aprofiten l'Apple Silicon de manera més eficient que el paquet original en Python, però tots dos requereixen compilar des del codi font.
Quina diferència hi ha entre openai-whisper, whisper.cpp i mlx-whisper?
openai-whisper és el paquet original de Python d'OpenAI — el més fàcil d'instal·lar amb pip, però més lent en Apple Silicon perquè passa pel backend MPS de PyTorch. whisper.cpp és una reimplementació en C++ que fa servir Metal directament i és significativament més ràpida, però cal clonar el repositori i compilar-lo tu mateix. mlx-whisper fa servir el framework MLX propi d'Apple i sol ser l'opció més ràpida en xips de la sèrie M, amb una configuració similar des del codi font. Cap dels tres inclou preprocessament d'àudio, edició de subtítols ni traducció — són motors de transcripció, no eines de subtitulació.
Hi ha alguna manera gratuïta d'executar Whisper al Mac sense programar?
El model Whisper en si és gratuït i de codi obert, però executar-lo sense cap configuració requereix una aplicació empaquetada en lloc de la biblioteca de Python en brut — algú s'ha d'encarregar de la instal·lació, la gestió del model i la interfície per tu. Subtitle Studio és una aplicació de Mac creada precisament per a això: sense terminal, sense dependències a gestionar, pagament únic en lloc de subscripció.
Subtitle Studio fa servir el mateix model de Whisper que la línia de comandes?
Subtitle Studio fa servir un model de Whisper optimitzat i ajustat, dissenyat per al tipus d'àudio mixt amb què realment treballen els creadors de vídeo — diàlegs sobre música, soroll de sala i parla multilingüe — combinat amb acceleració per a Apple Silicon. Ve embolcallat en un pipeline complet (preprocessament, filtratge d'al·lucinacions, alineació forçada, segmentació per NLP) en lloc del model independent que obtindries amb pip install openai-whisper. Consulta la nostra comparativa entre MacWhisper i Subtitle Studio per veure amb més detall com afecta aquest pipeline al resultat real.
Prova Subtitle Studio gratis
Pagament únic, sense subscripció. Funciona totalment offline al teu Mac.

