Tutti gli articoli
Whispermacguidano-codeopenaisottotitoli

Il modo più semplice per usare OpenAI Whisper su Mac senza scrivere codice

OpenAI Whisper è gratuito e preciso, ma farlo funzionare su Mac significa Python, Homebrew, FFmpeg e una serie di errori nel terminale. Ecco come ottenere la stessa trascrizione senza toccare una riga di codice.

·Tom Mong
Scarica per Mac — gratis
Il modo più semplice per usare OpenAI Whisper su Mac senza scrivere codice

Risposta rapida: il modello Whisper di OpenAI non è un'applicazione — è una libreria Python che si installa e si esegue da terminale, il che significa Homebrew, la versione giusta di Python, un ambiente virtuale, FFmpeg e (molto spesso) una serie di errori di dipendenze prima di ottenere anche solo una trascrizione. Se non vuoi toccare codice, la via più rapida verso la stessa trascrizione privata ed eseguita in locale è un'app per Mac che ha già Whisper incorporato — come Subtitle Studio — che salta del tutto la configurazione e aggiunge strumenti di pre-elaborazione e modifica che il Whisper "grezzo" non ha.

Se hai cercato "come eseguire Whisper su Mac" e sei finito su una guida in cui, prima del primo passaggio vero e proprio, ci sono già sei step senza che il tuo file audio venga nemmeno menzionato, non te lo stai immaginando. Ecco perché succede, dove la maggior parte delle persone si blocca e qual è l'alternativa senza codice.


Cos'è OpenAI Whisper (e perché non è un'applicazione)

Whisper è il modello open source di riconoscimento vocale di OpenAI, rilasciato nel 2022 e aggiornato regolarmente da allora (large-v3, turbo). È davvero eccellente — preciso in oltre 90 lingue, gratuito e funziona interamente sul tuo computer senza inviare alcun audio da nessuna parte. È esattamente per questo che così tante persone vogliono eseguirlo da sole.

Il repository GitHub openai/whisper — 106mila stelle, ma è solo un repository di codice sorgente, senza pulsante di download, senza installer e senza un'app da aprireIl repository GitHub openai/whisper — 106mila stelle, ma è solo un repository di codice sorgente, senza pulsante di download, senza installer e senza un'app da aprire

Nota cosa manca in quella pagina: un pulsante di download, un installer, un'icona dell'app. Quello che ottieni è una cartella di codice sorgente Python — 106.000 persone hanno messo una stella al repository, ma mettere una stella non installa assolutamente nulla sul tuo Mac.

Il repository GitHub è in realtà una base di codice per la ricerca, non un prodotto per il grande pubblico. Le istruzioni ufficiali di installazione danno per scontato che tu sappia già come:

  • Installare e gestire più versioni di Python
  • Usare pip e ambienti virtuali
  • Leggere una traccia di errore Python (traceback) quando qualcosa si rompe
  • Installare una dipendenza di sistema (FFmpeg) separatamente dal modello stesso

Nulla di tutto ciò è irragionevole per un ricercatore di machine learning. Ma è tanto chiedere a chi vuole semplicemente dei sottotitoli per un video YouTube entro stasera.


Il modo "ufficiale" per eseguire Whisper su Mac, passo dopo passo

Per essere onesti nei confronti del team Whisper, il README è scritto bene. Ecco cosa serve davvero per passare da "niente installato" a "una trascrizione sullo schermo."

Passo 1: Installa Homebrew

Se non hai già questo gestore di pacchetti non ufficiale di Apple, è la prima installazione:

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

Passo 2: Installa una versione compatibile di Python

La catena di dipendenze di Whisper (numba, tiktoken, PyTorch) non supporta le versioni più recenti di Python. Al momento in cui scriviamo, Python 3.13 fa fallire l'installazione — serve la 3.10, la 3.11 o la 3.12:

brew install python@3.11

Passo 3: Crea un ambiente virtuale

Per evitare che le dipendenze di Whisper entrino in conflitto con qualsiasi altra cosa sul tuo sistema, l'approccio consigliato è un ambiente isolato:

python3.11 -m venv whisper-env
source whisper-env/bin/activate

Passo 4: Installa FFmpeg

Whisper non decodifica l'audio da solo — delega questo compito a FFmpeg, che va installato a parte:

brew install ffmpeg

Passo 5: Installa Whisper

pip install -U openai-whisper

Passo 6: Esegui la tua prima trascrizione

whisper your-audio.mp3 --model turbo

Sei passaggi, tre installer separati, un vincolo sulla versione di Python che dovevi già conoscere in anticipo — e non hai ancora trascritto una sola parola. E questa è la versione in cui non va storto nulla.


Dove tutti si bloccano (problemi reali da GitHub e StackOverflow)

Cerca i problemi di installazione di "openai-whisper" e troverai sempre lo stesso pugno di errori che ritornano. Quello che segue è citato direttamente da segnalazioni reali, senza parafrasi.

"Whisper non può essere usato su Python 3.13"

Se installi l'ultima versione di Python da python.org invece di fissare una versione precedente con Homebrew, l'installazione fallisce immediatamente:

Getting requirements to build wheel ... error
KeyError: '__version__'

Come dice chiaramente una risposta nel thread: "Whisper cannot be used on Python 3.13 using only released, supported versions of its dependency chain." (Fonte: StackOverflow) La soluzione è tornare a una versione precedente di Python e ricostruire l'ambiente virtuale da zero — tutt'altro che ovvio se non sai già che Whisper è così sensibile alla versione.

"ffmpeg not found" — anche dopo aver installato ffmpeg

Questo è uno degli errori di Whisper più comuni su Mac, ed è fonte di confusione proprio perché sembra che la soluzione ovvia dovrebbe già aver funzionato:

FileNotFoundError: [Errno 2] No such file or directory: 'ffmpeg': 'ffmpeg'

L'utente in questo caso aveva già eseguito con successo brew install ffmpeg, lo aveva reinstallato e aveva persino provato un wrapper Python per FFmpeg — il vero problema era che l'eseguibile di FFmpeg non era nel PATH visibile a Python. (Fonte: StackOverflow) Diagnosticare un problema di PATH richiede già di sapere cosa sia un PATH.

Su Mac non c'è CUDA — e la maggior parte dei tutorial dà per scontato che ci sia

Quasi ogni guida sulle prestazioni di Whisper parla di CUDA, il framework GPU di NVIDIA. I Mac non hanno GPU NVIDIA. Apple Silicon usa invece MPS (Metal Performance Shaders), e il supporto di MPS in PyTorch presenta lacune reali e documentate:

NotImplementedError: The operator 'aten::isin.Tensor_Tensor_out' is not
currently implemented for the MPS device. ... you can set the environment
variable `PYTORCH_ENABLE_MPS_FALLBACK=1` to use the CPU as a fallback for
this op.

Questo è un errore reale riscontrato su un modello PyTorch affine a Whisper su Apple Silicon. (Fonte: GitHub — huggingface/transformers #31408) La soluzione suggerita ricade sulla CPU per quell'operazione — il che significa un'elaborazione più lenta per risolvere un bug che esiste solo perché stai usando un Mac.

Errori del compilatore Rust durante l'installazione

Whisper dipende dal tokenizzatore tiktoken di OpenAI. Se la tua piattaforma non ha una wheel precompilata disponibile, pip tenta di compilarla dal sorgente, il che richiede una toolchain Rust che probabilmente non hai installato. Il README ufficiale affronta la questione direttamente: se l'installazione fallisce con No module named 'setuptools_rust', devi installare separatamente setuptools-rust, e possibilmente l'intero ambiente di sviluppo Rust. Un'intera toolchain di compilazione da installare solo per eseguire un modello di riconoscimento vocale.

Le opzioni "più veloci" richiedono di compilare dal sorgente

Il Whisper standard su PyTorch è notevolmente lento su Mac, quindi il consiglio comune è passare a whisper.cpp o mlx-whisper per sfruttare davvero la velocità di Apple Silicon. Entrambi sono più veloci — ma entrambi scambiano la configurazione di Python con un altro tipo di configurazione:

git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
./models/download-ggml-model.sh large-v3
./main -m models/ggml-large-v3.bin -f your-audio.wav

Questo richiede git, una toolchain di compilazione C++ e il download manuale dei file del modello — non esattamente "senza codice." E anche dopo averlo compilato correttamente, le cose possono comunque andare storte in modi genuinamente difficili da diagnosticare. Un utente di lunga data ha descritto come, elaborando un lotto di file tramite un binario whisper.cpp compilato da lui su un Mac mini M4, tutto "funzioni perfettamente" su un M1, ma sull'M4 "semplicemente si fermi" a produrre output dopo qualche ora, senza errori né crash — e la soluzione è stata scrivere uno script per terminare e riavviare il processo ogni ora. ("Whisper continues running, there are no errors in the terminal, no crashes... there's just no more output.") (Fonte: Ars Technica OpenForum)

Non è un errore da principianti — è un utente esperto che ha comunque trovato un muro che solo uno script e un'attività pianificata sono riusciti ad aggirare.

"Il processo di installazione è estremamente ostile"

Questa lamentela, presentata come issue su GitHub per uno strumento basato su Whisper, riassume l'intera esperienza per chi non è sviluppatore: "The installer is extremely unfriendly, constantly interrupting the download of large files, resulting in incomplete installation and a missing executable file... For those without programming skills, uninstallation is the only option." (Fonte: GitHub — meizhong986/WhisperJAV #85) La risoluzione del thread è stata, ancora una volta, un'incompatibilità di versione di Python — con uno sconosciuto che ha guidato passo passo l'autore della segnalazione attraverso comandi da terminale finché non ha funzionato.

Anche quando funziona, i modelli grandi possono esaurire la memoria

Il modello large-v3 richiede circa 10 GB di VRAM/memoria unificata per funzionare comodamente. Su un MacBook base da 8 GB o 16 GB, questo margine è abbastanza risicato da far crashare direttamente il processo, costringendo a ripiegare su un modello più piccolo e meno preciso come soluzione.


Anche se riesci a farlo funzionare, Whisper da solo non produce sottotitoli

Supponiamo che tu superi tutto quanto sopra e ottenga un comando funzionante whisper your-video.mp4 --model large-v3. Quello che ottieni indietro è una trascrizione, non sottotitoli — e per un video è tutto un altro lavoro:

  • Nessuna pre-elaborazione. Whisper riceve il tuo audio grezzo così com'è. Se c'è musica di sottofondo, eco della stanza o un'intro rumorosa, il modello non ha idea di doverla ignorare — ed è ben documentato che allucina testo (ripetendo frasi, inventando dialoghi) durante i silenzi e i letti musicali invece di ammettere incertezza.
  • Sincronizzazione approssimativa. I timestamp integrati di Whisper sono arrotondati approssimativamente al secondo più vicino — va bene per una trascrizione, non per un sottotitolo che deve apparire esattamente quando qualcuno parla.
  • Nessuna logica di interruzione di riga. Blocchi lunghi e ininterrotti o interruzioni scomode a metà frase sono comuni nell'output grezzo, e non c'è alcuno strumento per correggerli se non aprire l'.srt in un editor di testo.
  • Nessuna traduzione. Se serve una traccia in una seconda lingua, si tratta di uno strumento e un flusso di lavoro completamente separati.
  • Nessuna interfaccia di modifica. Tutto avviene sulla riga di comando. Non c'è forma d'onda, non c'è trascina-per-regolare, non c'è pulsante annulla.

In altre parole, risolvere il problema dell'installazione non risolve il problema dei sottotitoli. Ti servirà comunque un secondo strumento per trasformare una trascrizione grezza in qualcosa che vorresti davvero pubblicare.


Il modo più semplice: saltare Python del tutto con Subtitle Studio

Subtitle Studio esegue la stessa classe di modello Whisper, ma come app nativa per Mac: la scarichi, trascini dentro il tuo video e ottieni indietro i sottotitoli. Nessun terminale, nessuna versione di Python da gestire, nessun errore di pip install da risolvere.

Editor di Subtitle Studio con forma d'onda, elenco sottotitoli e anteprima video allineati al parlatoEditor di Subtitle Studio con forma d'onda, elenco sottotitoli e anteprima video allineati al parlato

Ecco cosa ottieni in più rispetto a un'installazione senza terminale:

  • Modello ottimizzato per Apple Silicon. Il modello di trascrizione è ottimizzato specificamente per i chip serie M con accelerazione Metal — non una build PyTorch generica che ricade sulla CPU per le operazioni MPS non supportate.
  • Pre-elaborazione prima della trascrizione. Il rilevamento dell'attività vocale (VAD) e la riduzione del rumore ripuliscono l'audio prima che Whisper lo veda, così musica di sottofondo e rumore ambientale causano meno parole perse e meno testo allucinato — esattamente la modalità di fallimento per cui Whisper "grezzo" è noto.
  • Filtraggio delle allucinazioni. Un punteggio di affidabilità combinato con l'analisi dell'attività vocale rileva e rimuove il testo fantasma che il modello inventa durante silenzi o musica, invece di spedirlo direttamente nel tuo file di sottotitoli.
  • Allineamento forzato. Dopo la trascrizione, un allineatore forzato rimappa il testo sulla forma d'onda a livello di parola, sostituendo i timestamp di Whisper, arrotondati a circa un secondo, con una sincronizzazione precisa al fotogramma.
  • Segmentazione basata su NLP. La trascrizione grezza viene suddivisa in righe di sottotitoli leggibili ai confini naturali delle frasi, invece che a un numero arbitrario di caratteri.
  • Editing integrato. Trascina per riallineare i tempi di un sottotitolo, dividi una riga troppo lunga o unisci frammenti spezzati — senza mai esportare in un editor di testo.

Strumento di riallineamento di Subtitle Studio con un blocco di sottotitolo trascinato per farlo corrispondere alla forma d'onda audioStrumento di riallineamento di Subtitle Studio con un blocco di sottotitolo trascinato per farlo corrispondere alla forma d'onda audio

  • Traduzione sul dispositivo. Traduci i tuoi sottotitoli finiti in 25 lingue, interamente offline, senza chiave API e senza costo per parola — vedi il nostro approfondimento sulla traduzione offline per capire come funziona il modello locale.

Pannello di traduzione di Subtitle Studio con selettore lingua e opzioni per il fornitore di IAPannello di traduzione di Subtitle Studio con selettore lingua e opzioni per il fornitore di IA

Il tuo audio e video non lasciano mai il tuo Mac — la stessa garanzia di privacy che avresti eseguendo Whisper da solo, ma senza la configurazione.

Subtitle Studio

Acquisto una tantum. Funziona interamente offline sul tuo Mac.


Whisper da riga di comando vs Subtitle Studio — confronto diretto

OpenAI Whisper (CLI)Subtitle Studio
ConfigurazioneHomebrew, gestione versione Python, ambiente virtuale, FFmpeg, pip installScaricare l'app, aprirla
Codice richiestoSì — comandi da terminale, occasionale debug delle dipendenzeNo
Accelerazione Apple SiliconDipende dal supporto MPS di PyTorch (con lacune)Integrata, modello ottimizzato per Metal
Pre-elaborazione audioNessuna — audio grezzo inviato direttamente al modelloVAD + riduzione del rumore prima della trascrizione
Gestione delle allucinazioniNessuna — output grezzo del modelloRilevate e filtrate automaticamente
Precisione timestampGranularità di circa 1 secondoAllineamento forzato a livello di parola
Interruzione di riga dei sottotitoliNessuna — richiede pulizia manualeSegmentazione automatica basata su NLP
Strumenti di editingEditor di testo sul file esportatoRiallineamento, divisione e unione basati su forma d'onda
TraduzioneNon inclusaIntegrata, offline, 25 lingue
Formato di output.txt, .srt, .vtt.srt, .fcpxml
CostoGratuito (il tuo tempo)Acquisto una tantum

Verdetto

Se sei uno sviluppatore che vuole integrare Whisper in una pipeline scriptata, elaborare migliaia di file in batch o affinare il modello da solo, lo strumento CLI ufficiale è la scelta giusta — quella flessibilità è esattamente ciò per cui è stato costruito, e il costo di configurazione si paga solo una volta.

Se vuoi semplicemente sottotitoli precisi e pronti da pubblicare per un video senza aprire un terminale, la via senza codice ti porta lì più in fretta: la stessa tecnologia di base, senza la gestione dell'ambiente, più un insieme di strumenti specifici per i sottotitoli che il Whisper grezzo non è mai stato progettato per includere.

Subtitle Studio

Niente Python, niente Homebrew, niente terminale. Basta trascinare il tuo video.


Domande frequenti

Devo conoscere Python per eseguire Whisper su Mac?

Per usare il pacchetto ufficiale openai-whisper, sì — dovrai installare Python, gestire un ambiente virtuale ed eseguire comandi dal terminale. Se preferisci non toccare codice, app come Subtitle Studio eseguono la stessa classe di modello con un'interfaccia drag-and-drop, senza bisogno di scrivere codice.

Perché l'installazione di Whisper fallisce sul mio Mac?

Le cause più comuni sono: usare una versione di Python non supportata (attualmente la 3.13 fa fallire l'installazione; usa la 3.10–3.12), FFmpeg non presente nel PATH di sistema anche dopo averlo installato, e la mancanza di un compilatore Rust necessario per compilare la dipendenza tiktoken dal sorgente. Ognuna di queste produce un messaggio di errore diverso e piuttosto criptico.

Whisper usa la GPU del mio Mac?

Può farlo, tramite il backend MPS (Metal Performance Shaders) di Apple in PyTorch, ma il supporto MPS per le operazioni di Whisper presenta lacune documentate — alcuni operatori non sono implementati e ricadono silenziosamente su un'esecuzione CPU più lenta. whisper.cpp e mlx-whisper generalmente sfruttano Apple Silicon in modo più efficiente rispetto al pacchetto Python originale, ma entrambi richiedono la compilazione dal sorgente.

Qual è la differenza tra openai-whisper, whisper.cpp e mlx-whisper?

openai-whisper è il pacchetto Python originale di OpenAI — il più semplice da installare via pip, ma più lento su Apple Silicon poiché passa attraverso il backend MPS di PyTorch. whisper.cpp è una reimplementazione in C++ che usa Metal direttamente ed è significativamente più veloce, ma bisogna clonare il repository e compilarlo da soli. mlx-whisper usa il framework MLX proprietario di Apple ed è spesso l'opzione più veloce sui chip serie M, con una configurazione dal sorgente simile. Nessuno dei tre include pre-elaborazione audio, editing dei sottotitoli o traduzione — sono motori di trascrizione, non strumenti per sottotitoli.

Esiste un modo gratuito per eseguire Whisper su Mac senza scrivere codice?

Il modello Whisper in sé è gratuito e open source, ma eseguirlo senza alcuna configurazione richiede un'app confezionata piuttosto che la libreria Python grezza — qualcuno deve occuparsi dell'installazione, della gestione del modello e dell'interfaccia al posto tuo. Subtitle Studio è un'app per Mac costruita appositamente per questo: niente terminale, nessuna dipendenza da gestire, acquisto una tantum invece di un abbonamento.

Subtitle Studio usa lo stesso modello Whisper della riga di comando?

Subtitle Studio usa un modello Whisper ottimizzato e affinato per il tipo di audio misto con cui i creator di video lavorano realmente — dialoghi sopra la musica, rumore ambientale e parlato multilingue — abbinato all'accelerazione Apple Silicon. È racchiuso in una pipeline completa (pre-elaborazione, filtraggio delle allucinazioni, allineamento forzato, segmentazione NLP) invece di essere il modello autonomo che otterresti con pip install openai-whisper. Guarda il nostro confronto tra MacWhisper e Subtitle Studio per uno sguardo più approfondito su come questa pipeline influisce sul risultato reale.

Prova Subtitle Studio gratuitamente

Pagamento unico. Senza abbonamento. Completamente offline sul tuo Mac.

Scarica per Mac — gratis