Wszystkie artykuły
Whispermacporadnikbez koduopenainapisy

Najprostszy sposób na uruchomienie OpenAI Whisper na Macu (bez programowania)

Whisper od OpenAI jest darmowy i dokładny, ale na Macu wymaga Pythona, Homebrew, FFmpeg i błędów w terminalu. Oto sposób na tę samą transkrypcję bez pisania kodu.

·Tom Mong
Pobierz na Mac — bezpłatnie
Najprostszy sposób na uruchomienie OpenAI Whisper na Macu (bez programowania)

Krótka odpowiedź: sam model Whisper od OpenAI nie jest aplikacją — to biblioteka Pythona, którą instalujesz i uruchamiasz z terminala, co oznacza Homebrew, właściwą wersję Pythona, środowisko wirtualne, FFmpeg i (bardzo często) stertę błędów zależności, zanim w ogóle zobaczysz pierwszy transkrypt. Jeśli nie chcesz dotykać kodu, najszybszą drogą do tej samej prywatnej transkrypcji na urządzeniu jest aplikacja na Maca, która ma Whisper już wbudowany — jak Subtitle Studio — która całkowicie pomija konfigurację i dorzuca narzędzia do wstępnej obróbki i edycji, których surowy Whisper nie ma.

Jeśli szukałeś „jak uruchomić Whisper na Macu" i trafiłeś na poradnik, w którym sześć kroków mija, zanim krok pierwszy w ogóle wspomni o twoim pliku audio — to nie twoja wyobraźnia. Oto dlaczego tak się dzieje, gdzie ludzie utykają najczęściej i jaka jest alternatywa bez pisania kodu.


Czym Jest OpenAI Whisper (I Dlaczego To Nie Jest Aplikacja)

Whisper to otwartoźródłowy model rozpoznawania mowy od OpenAI, wydany w 2022 roku i od tamtej pory aktualizowany (large-v3, turbo). Jest naprawdę świetny — dokładny w ponad 90 językach, darmowy w użyciu i działa całkowicie na twoim własnym urządzeniu, bez wysyłania nagrań gdziekolwiek. Właśnie dlatego tak wiele osób chce uruchomić go samodzielnie.

Repozytorium GitHub openai/whisper — 106 tys. gwiazdek, ale to repozytorium z kodem źródłowym, bez przycisku pobierania, bez instalatora i bez aplikacji do otwarciaRepozytorium GitHub openai/whisper — 106 tys. gwiazdek, ale to repozytorium z kodem źródłowym, bez przycisku pobierania, bez instalatora i bez aplikacji do otwarcia

Zwróć uwagę, czego na tej stronie brakuje: przycisku pobierania, instalatora, ikony aplikacji. Dostajesz folder z kodem źródłowym w Pythonie — 106 tysięcy osób dało temu repozytorium gwiazdkę, ale danie gwiazdki niczego na twoim Macu nie instaluje.

Repozytorium na GitHubie to jednak kod badawczy, a nie produkt konsumencki. Oficjalne instrukcje instalacji zakładają, że swobodnie:

  • instalujesz i zarządzasz różnymi wersjami Pythona,
  • korzystasz z pip i środowisk wirtualnych,
  • czytasz traceback Pythona, gdy coś się psuje,
  • instalujesz zależność systemową (FFmpeg) osobno od samego modelu.

Żadne z tych wymagań nie jest niczym niezwykłym dla badacza uczenia maszynowego. To za to sporo wymagań wobec kogoś, kto po prostu chce mieć napisy do filmu na YouTube jeszcze dziś wieczorem.


„Oficjalny" Sposób Uruchomienia Whisper na Macu, Krok Po Kroku

W obronie zespołu Whisper trzeba przyznać, że README jest dobrze napisane. Oto co naprawdę trzeba zrobić, żeby przejść od „nic nie zainstalowane" do „transkrypt na ekranie".

Krok 1: Zainstaluj Homebrew

Jeśli nie masz jeszcze nieoficjalnego menedżera pakietów Apple'a, to pierwsza instalacja:

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

Krok 2: Zainstaluj kompatybilną wersję Pythona

Łańcuch zależności Whispera (numba, tiktoken, PyTorch) nie obsługuje najnowszych wersji Pythona. W chwili pisania tego tekstu Python 3.13 psuje instalację — potrzebujesz 3.10, 3.11 lub 3.12:

brew install python@3.11

Krok 3: Utwórz środowisko wirtualne

Żeby uniknąć kolizji zależności Whispera z czymkolwiek innym w systemie, zalecanym podejściem jest izolowane środowisko:

python3.11 -m venv whisper-env
source whisper-env/bin/activate

Krok 4: Zainstaluj FFmpeg

Whisper sam nie dekoduje dźwięku — wywołuje FFmpeg, który trzeba zainstalować osobno:

brew install ffmpeg

Krok 5: Zainstaluj Whisper

pip install -U openai-whisper

Krok 6: Uruchom pierwszą transkrypcję

whisper your-audio.mp3 --model turbo

Sześć kroków, trzy osobne instalatory, jedno ograniczenie wersji Pythona, o którym trzeba było wiedzieć wcześniej — a jeszcze nie przetranskrybowałeś ani jednego słowa. I to w wersji, w której nic nie poszło źle.


Gdzie Wszyscy Utykają (Prawdziwe Problemy Z GitHuba I StackOverflow)

Wyszukaj problemy z instalacją „openai-whisper", a natrafisz w kółko na te same kilka błędów. Cytujemy je bezpośrednio z prawdziwych zgłoszeń, bez parafrazowania.

„Whisper cannot be used on Python 3.13"

Jeśli zainstalujesz najnowszego Pythona z python.org zamiast przypiąć starszą wersję przez Homebrew, instalacja zawiedzie natychmiast:

Getting requirements to build wheel ... error
KeyError: '__version__'

Jak wprost stwierdza jedna z odpowiedzi w wątku: „Whisper cannot be used on Python 3.13 using only released, supported versions of its dependency chain." (Źródło: StackOverflow) Rozwiązaniem jest obniżenie wersji Pythona i odbudowanie środowiska wirtualnego od zera — co nie jest oczywiste, jeśli nie wiesz wcześniej, że Whisper jest tak wrażliwy na wersje.

„ffmpeg not found" — nawet po zainstalowaniu ffmpeg

To jeden z najczęstszych błędów Whispera na Macu i jest mylący właśnie dlatego, że wygląda, jakby rozwiązanie powinno już zadziałać:

FileNotFoundError: [Errno 2] No such file or directory: 'ffmpeg': 'ffmpeg'

Użytkownik w tym przypadku już wcześniej pomyślnie uruchomił brew install ffmpeg, przeinstalował go, a nawet wypróbował pythonowy wrapper do FFmpeg — prawdziwym problemem było to, że plik binarny FFmpeg nie znajdował się w PATH, który widział Python. (Źródło: StackOverflow) Diagnozowanie problemu z PATH wymaga wiedzy, czym w ogóle jest PATH.

Na Macu nie ma CUDA — a większość poradników zakłada, że jest

Niemal każdy poradnik o wydajności Whispera mówi o CUDA, frameworku GPU od NVIDIA. Maki nie mają kart graficznych NVIDIA. Apple Silicon używa zamiast tego MPS (Metal Performance Shaders), a wsparcie MPS w PyTorchu ma realne, udokumentowane luki:

NotImplementedError: The operator 'aten::isin.Tensor_Tensor_out' is not
currently implemented for the MPS device. ... you can set the environment
variable `PYTORCH_ENABLE_MPS_FALLBACK=1` to use the CPU as a fallback for
this op.

To prawdziwy błąd z modelu PyTorch pokrewnego Whisperowi na Apple Silicon. (Źródło: GitHub — huggingface/transformers #31408) Sugerowane obejście polega na przełączeniu tej operacji na CPU — czyli wolniejszym przetwarzaniu, żeby naprawić błąd, który istnieje tylko dlatego, że w ogóle korzystasz z Maca.

Błędy kompilatora Rust podczas instalacji

Whisper zależy od tokenizera tiktoken firmy OpenAI. Jeśli twoja platforma nie ma dostępnego gotowego pakietu wheel, pip próbuje skompilować go ze źródeł, co wymaga toolchainu Rust, którego prawdopodobnie nie masz zainstalowanego. Oficjalne README wprost się do tego odnosi: jeśli instalacja zawiedzie z komunikatem No module named 'setuptools_rust', musisz osobno zainstalować setuptools-rust, a być może całe środowisko deweloperskie Rusta. To instalacja toolchainu kompilatora tylko po to, żeby uruchomić model zamiany mowy na tekst.

„Szybsze" opcje wymagają kompilacji ze źródeł

Zwykły Whisper na PyTorchu jest zauważalnie wolny na Macu, więc częstą radą jest przejście na whisper.cpp lub mlx-whisper, żeby wykorzystać prawdziwą szybkość Apple Silicon. Oba są szybsze — i oba zamieniają konfigurację Pythona na inny rodzaj konfiguracji:

git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
./models/download-ggml-model.sh large-v3
./main -m models/ggml-large-v3.bin -f your-audio.wav

To git, toolchain kompilatora C++ i ręczne pobieranie plików modelu — trudno to nazwać „bez programowania". A nawet po prawidłowej kompilacji sprawy mogą się skomplikować w sposób naprawdę trudny do zdiagnozowania. Jeden z długoletnich użytkowników opisał przetwarzanie partii plików przez samodzielnie skompilowany plik binarny whisper.cpp na Mac mini M4: na M1 „działa całkiem dobrze", ale na M4 po kilku godzinach po prostu „przestaje" dawać jakikolwiek wynik, bez błędu, bez zawieszenia — a rozwiązaniem było napisanie skryptu, który co godzinę zabijał i restartował proces. („Whisper continues running, there are no errors in the terminal, no crashes... there's just no more output.") (Źródło: Ars Technica OpenForum)

To nie jest błąd początkującego — to doświadczony użytkownik, który i tak trafił na ścianę wymagającą skryptu i zadania cron, żeby ją obejść.

„Proces instalacji jest wyjątkowo nieprzyjazny"

Ta skarga, zgłoszona jako issue na GitHubie do narzędzia opartego na Whisperze, podsumowuje całe doświadczenie osób niebędących programistami: „The installer is extremely unfriendly, constantly interrupting the download of large files, resulting in incomplete installation and a missing executable file... For those without programming skills, uninstallation is the only option." (Źródło: GitHub — meizhong986/WhisperJAV #85) Rozwiązaniem w tym wątku była, znowu, niezgodność wersji Pythona — obcy użytkownik przeprowadzał zgłaszającego przez polecenia terminala, aż zadziałało.

Nawet gdy działa, duże modele mogą wyczerpać pamięć

Model large-v3 potrzebuje mniej więcej 10 GB VRAM/pamięci zunifikowanej, żeby działać komfortowo. Na podstawowym MacBooku z 8 GB lub 16 GB pamięci to wystarczająco mało, by proces wprost się wywalił, zmuszając do przejścia na mniejszy, mniej dokładny model jako obejście.


Nawet Jeśli Uda Ci Się Go Uruchomić, Sam Whisper To Wciąż Nie Napisy

Załóżmy, że przebrnąłeś przez to wszystko i masz działające polecenie whisper your-video.mp4 --model large-v3. To, co dostajesz, to transkrypt, a nie napisy — a dla wideo to zupełnie inne zadanie:

  • Brak wstępnej obróbki. Whisper odbiera twój surowy dźwięk taki, jaki jest. Jeśli w tle jest muzyka, echo pomieszczenia albo hałaśliwe intro, model nie ma pojęcia, że powinien to zignorować — i jest dobrze udokumentowane, że halucynuje tekst (powtarza frazy, wymyśla dialogi) podczas ciszy i podkładu muzycznego zamiast przyznać się do niepewności.
  • Przybliżony czas. Wbudowane znaczniki czasu Whispera są zaokrąglone mniej więcej do najbliższej sekundy — w porządku dla transkryptu, ale nie dla napisu, który musi pojawić się dokładnie w momencie, gdy ktoś zaczyna mówić.
  • Brak logiki podziału wierszy. Długie, ciągnące się bloki lub niezręczne podziały w środku zdania są w surowym wyniku powszechne, a nie ma żadnego narzędzia, żeby to poprawić poza otwarciem pliku .srt w edytorze tekstu.
  • Brak tłumaczenia. Jeśli potrzebujesz ścieżki w drugim języku, to zupełnie osobne narzędzie i osobny proces.
  • Brak interfejsu do edycji. Wszystko dzieje się w wierszu poleceń. Nie ma przebiegu fali, przeciągania do korekty, przycisku cofnij.

Innymi słowy, rozwiązanie problemu z instalacją nie rozwiązuje problemu z napisami. I tak kończysz z potrzebą drugiego narzędzia, żeby zamienić surowy transkrypt w coś, co faktycznie chciałbyś opublikować.


Najprostszy Sposób: Pomiń Pythona Całkowicie Dzięki Subtitle Studio

Subtitle Studio uruchamia ten sam rodzaj modelu Whisper, ale jako natywna aplikacja na Maca: pobierasz ją, przeciągasz wideo i dostajesz napisy z powrotem. Bez terminala, bez zarządzania wersją Pythona, bez debugowania pip install.

Edytor Subtitle Studio z przebiegiem fali dźwiękowej, listą napisów i podglądem wideo dopasowanym do mowyEdytor Subtitle Studio z przebiegiem fali dźwiękowej, listą napisów i podglądem wideo dopasowanym do mowy

Oprócz instalacji bez terminala dostajesz dodatkowo:

  • Model dostrojony pod Apple Silicon. Model transkrypcji jest zoptymalizowany specjalnie pod chipy serii M z przyspieszeniem Metal — nie generyczna kompilacja PyTorcha przełączająca się na CPU przy nieobsługiwanych operacjach MPS.
  • Wstępną obróbkę przed transkrypcją. Detekcja aktywności głosowej (VAD) i redukcja szumów czyszczą dźwięk, zanim zobaczy go Whisper, więc muzyka w tle i hałas pomieszczenia powodują mniej zgubionych słów i mniej zhalucynowanego tekstu — dokładnie tego, za co surowy Whisper jest znany.
  • Filtrowanie halucynacji. Ocena pewności i analiza aktywności mowy wychwytują i usuwają zjawy tekstowe wymyślone przez model podczas ciszy lub muzyki, zamiast wysyłać je prosto do pliku z napisami.
  • Wymuszone dopasowanie. Po transkrypcji wymuszony aligner mapuje tekst z powrotem na przebieg fali na poziomie słów, zastępując zaokrąglone do ~1 sekundy znaczniki czasu Whispera dokładnością co do klatki.
  • Segmentację opartą na NLP. Surowy transkrypt jest dzielony na czytelne linie napisów na naturalnych granicach fraz, zamiast na podstawie dowolnej liczby znaków.
  • Wbudowaną edycję. Przeciągnij, żeby przesunąć czas napisu, podziel zbyt długą linię lub scal rozdrobnione fragmenty — bez eksportowania do edytora tekstu.

Narzędzie do ponownego wyrównania w Subtitle Studio z blokiem napisów przeciąganym, żeby dopasować się do przebiegu fali dźwiękowejNarzędzie do ponownego wyrównania w Subtitle Studio z blokiem napisów przeciąganym, żeby dopasować się do przebiegu fali dźwiękowej

  • Tłumaczenie na urządzeniu. Przetłumacz gotowe napisy na 25 języków, całkowicie offline, bez klucza API i bez opłat za słowo — zobacz nasz dogłębny artykuł o tłumaczeniu offline, żeby dowiedzieć się, jak działa lokalny model.

Panel tłumaczenia Subtitle Studio z selektorem języka i opcjami dostawcy AIPanel tłumaczenia Subtitle Studio z selektorem języka i opcjami dostawcy AI

Twój dźwięk i wideo nigdy nie opuszczają twojego Maca — ta sama gwarancja prywatności co przy samodzielnym uruchamianiu Whispera, tylko bez konfiguracji.

Subtitle Studio

Jednorazowy zakup. Działa całkowicie offline na twoim Macu.


Whisper CLI kontra Subtitle Studio — Zestawienie

OpenAI Whisper (CLI)Subtitle Studio
KonfiguracjaHomebrew, zarządzanie wersją Pythona, środowisko wirtualne, FFmpeg, instalacja pipPobierz aplikację, otwórz ją
Wymagane programowanieTak — polecenia terminala, okazjonalne debugowanie zależnościNie
Przyspieszenie Apple SiliconZależy od wsparcia MPS w PyTorchu (istnieją luki)Wbudowany, zoptymalizowany pod Metal model
Wstępna obróbka dźwiękuBrak — surowy dźwięk trafia prosto do modeluVAD + redukcja szumów przed transkrypcją
Obsługa halucynacjiBrak — surowy wynik modeluWykrywane i filtrowane automatycznie
Dokładność znaczników czasuDokładność rzędu ~1 sekundyWymuszone dopasowanie na poziomie słów
Podział napisów na linieBrak — wymagane ręczne porządkowanieAutomatyczna segmentacja oparta na NLP
Narzędzia do edycjiEdytor tekstu na wyeksportowanym plikuPonowne wyrównanie, podział, scalanie na podstawie fali dźwiękowej
TłumaczenieNiedołączoneWbudowane, offline, 25 języków
Format wyjściowy.txt, .srt, .vtt.srt, .fcpxml
KosztDarmowy (twój czas)Jednorazowy zakup

Werdykt

Jeśli jesteś programistą, który chce wpiąć Whispera skryptem do potoku, przetwarzać wsadowo tysiące plików albo samodzielnie dostroić model, oficjalny CLI to właściwe narzędzie — ta elastyczność jest dokładnie tym, do czego został zbudowany, a koszt konfiguracji płacisz tylko raz.

Jeśli po prostu chcesz dokładnych, gotowych do publikacji napisów do filmu bez otwierania terminala, ścieżka bez kodu zaprowadzi cię tam szybciej: ta sama technologia u podstaw, żadnego zarządzania środowiskiem i zestaw narzędzi specyficznych dla napisów, których surowy Whisper nigdy nie miał w zamyśle zawierać.

Subtitle Studio

Bez Pythona, bez Homebrew, bez terminala. Po prostu przeciągnij swoje wideo.


Najczęściej Zadawane Pytania

Czy muszę znać Pythona, żeby uruchomić Whisper na Macu?

Żeby korzystać z oficjalnego pakietu openai-whisper — tak, będziesz musiał zainstalować Pythona, zarządzać środowiskiem wirtualnym i uruchamiać polecenia z terminala. Jeśli wolisz nie dotykać kodu, aplikacje takie jak Subtitle Studio uruchamiają ten sam rodzaj modelu z interfejsem przeciągnij-i-upuść, bez konieczności programowania.

Dlaczego instalacja Whispera zawodzi na moim Macu?

Najczęstsze przyczyny to: użycie nieobsługiwanej wersji Pythona (3.13 obecnie psuje instalację; użyj 3.10–3.12), FFmpeg niedostępny w systemowym PATH mimo zainstalowania, oraz brak kompilatora Rust potrzebnego do zbudowania zależności tiktoken ze źródeł. Każda z nich generuje inny, dość niejasny komunikat błędu.

Czy Whisper korzysta z GPU mojego Maca?

Może, poprzez backend MPS (Metal Performance Shaders) Apple'a w PyTorchu, ale wsparcie MPS dla operacji Whispera ma udokumentowane luki — niektóre operatory nie są zaimplementowane i po cichu przełączają się na wolniejsze wykonanie na CPU. whisper.cpp i mlx-whisper zazwyczaj wykorzystują Apple Silicon efektywniej niż oryginalny pakiet Pythona, ale oba wymagają kompilacji ze źródeł.

Jaka jest różnica między openai-whisper, whisper.cpp a mlx-whisper?

openai-whisper to oryginalny pakiet Pythona od OpenAI — najłatwiejszy do zainstalowania przez pip, ale wolniejszy na Apple Silicon, bo działa przez backend MPS PyTorcha. whisper.cpp to reimplementacja w C++, która korzysta bezpośrednio z Metal i jest znacznie szybsza, ale musisz sklonować repozytorium i skompilować je samodzielnie. mlx-whisper używa własnego frameworku MLX Apple'a i często jest najszybszą opcją na chipach serii M, przy podobnej konfiguracji ze źródeł. Żaden z tych trzech nie zawiera wstępnej obróbki dźwięku, edycji napisów ani tłumaczenia — to silniki transkrypcji, nie narzędzia do napisów.

Czy istnieje darmowy sposób na uruchomienie Whispera na Macu bez programowania?

Sam model Whisper jest darmowy i otwartoźródłowy, ale uruchomienie go bez żadnej konfiguracji wymaga gotowej aplikacji zamiast surowej biblioteki Pythona — ktoś musi zająć się instalacją, zarządzaniem modelem i interfejsem za ciebie. Subtitle Studio to aplikacja na Maca zbudowana specjalnie w tym celu: bez terminala, bez zależności do zarządzania, jednorazowy zakup zamiast subskrypcji.

Czy Subtitle Studio korzysta z tego samego modelu Whisper co wiersz poleceń?

Subtitle Studio korzysta ze zoptymalizowanego, dostrojonego modelu Whisper zbudowanego pod rodzaj mieszanego dźwięku, z jakim faktycznie pracują twórcy wideo — dialog na tle muzyki, hałas pomieszczenia i wielojęzyczna mowa — w połączeniu z przyspieszeniem Apple Silicon. Jest zapakowany w pełny potok (wstępna obróbka, filtrowanie halucynacji, wymuszone dopasowanie, segmentacja NLP), a nie w samodzielny model, jaki dostałbyś z pip install openai-whisper. Zobacz nasze porównanie MacWhisper i Subtitle Studio, żeby bliżej przyjrzeć się, jak ten potok wpływa na realny wynik.

Wypróbuj Subtitle Studio bezpłatnie

Płatność jednorazowa. Bez subskrypcji. W pełni offline na Twoim Macu.

Pobierz na Mac — bezpłatnie