Semua artikel
Whispermactutorialtanpa-kodopenaisarikata

Cara Paling Mudah Menjalankan OpenAI Whisper di Mac (Tanpa Coding)

OpenAI Whisper percuma dan tepat, tetapi menjalankannya di Mac bermakna berurusan dengan Python, Homebrew, FFmpeg dan bertimbun ralat terminal. Ini cara mendapatkan transkripsi yang sama tanpa menyentuh sebarang kod.

·Tom Mong
Muat turun Mac — Percuma
Cara Paling Mudah Menjalankan OpenAI Whisper di Mac (Tanpa Coding)

Jawapan pantas: Model Whisper daripada OpenAI itu sendiri bukan sebuah aplikasi — ia adalah pustaka Python yang perlu dipasang dan dijalankan melalui terminal, bermakna anda perlukan Homebrew, versi Python yang betul, virtual environment, FFmpeg, dan (selalunya) bertimbun ralat dependency sebelum sempat mendapat satu transkrip pun. Jika anda tidak mahu menyentuh kod langsung, cara paling pantas untuk mendapat transkripsi setempat dan peribadi yang sama ialah dengan aplikasi Mac yang sudah membenamkan Whisper di dalamnya — seperti Subtitle Studio — yang terus melangkau keseluruhan proses persediaan itu dan menambah alat pra-pemprosesan serta penyuntingan yang tiada pada Whisper mentah.

Jika anda pernah mencari "cara jalankan Whisper di Mac" dan terjumpa panduan yang ada enam langkah sebelum langkah pertama pun sempat menyebut fail audio anda, anda tidak tersalah baca. Ini sebabnya kenapa begitu, di mana kebanyakan orang tersekat, dan alternatif tanpa coding yang ada.


Apakah OpenAI Whisper (Dan Kenapa Ia Bukan Aplikasi)

Whisper ialah model pengecaman suara sumber terbuka milik OpenAI, dilancarkan pada 2022 dan terus dikemas kini (large-v3, turbo). Ia memang cemerlang — tepat dalam lebih 90 bahasa, percuma digunakan, dan berjalan sepenuhnya pada peranti anda sendiri tanpa sebarang audio dimuat naik ke mana-mana. Itulah sebabnya ramai yang mahu menjalankannya sendiri.

Repositori GitHub openai/whisper — 106 ribu bintang, tetapi hanya repositori kod sumber tanpa butang muat turun, tanpa pemasang, dan tiada aplikasi untuk dibukaRepositori GitHub openai/whisper — 106 ribu bintang, tetapi hanya repositori kod sumber tanpa butang muat turun, tanpa pemasang, dan tiada aplikasi untuk dibuka

Perhatikan apa yang tiada pada halaman itu: butang muat turun, pemasang, ikon aplikasi. Apa yang anda dapat sebenarnya ialah folder kod sumber Python — 106,000 orang sudah memberi bintang kepada repositori ini, tetapi memberi bintang tidak akan memasang apa-apa pun pada Mac anda.

Tetapi repositori GitHub ini adalah pangkalan kod penyelidikan, bukan produk untuk pengguna biasa. Arahan pemasangan rasmi menganggap anda sudah biasa dengan:

  • Memasang dan menguruskan pelbagai versi Python
  • Menggunakan pip dan virtual environment
  • Membaca traceback Python apabila sesuatu gagal
  • Memasang dependensi sistem (FFmpeg) secara berasingan daripada model itu sendiri

Semua itu tidak melampau untuk penyelidik machine learning. Tetapi itu satu tuntutan besar untuk seseorang yang hanya mahu sarikata untuk video YouTube malam ini juga.


Cara "Rasmi" Menjalankan Whisper di Mac, Langkah demi Langkah

Secara adilnya, README Whisper ditulis dengan baik. Berikut apa yang sebenarnya diperlukan untuk berpindah daripada "tiada apa-apa dipasang" kepada "transkrip terpapar di skrin."

Langkah 1: Pasang Homebrew

Jika anda belum ada pengurus pakej tidak rasmi Apple ini, itulah pemasangan pertama:

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

Langkah 2: Pasang versi Python yang serasi

Rantaian dependensi Whisper (numba, tiktoken, PyTorch) tidak menyokong keluaran Python terkini. Setakat penulisan ini, Python 3.13 menyebabkan pemasangan gagal — anda perlukan 3.10, 3.11, atau 3.12:

brew install python@3.11

Langkah 3: Cipta virtual environment

Untuk mengelakkan dependensi Whisper berlanggar dengan apa-apa lain pada sistem anda, pendekatan yang disyorkan ialah environment yang terasing:

python3.11 -m venv whisper-env
source whisper-env/bin/activate

Langkah 4: Pasang FFmpeg

Whisper tidak menyahkod audio sendiri — ia memanggil FFmpeg, iaitu pemasangan berasingan:

brew install ffmpeg

Langkah 5: Pasang Whisper

pip install -U openai-whisper

Langkah 6: Jalankan transkripsi pertama anda

whisper your-audio.mp3 --model turbo

Enam langkah, tiga pemasang berasingan, satu had versi Python yang anda perlu tahu lebih awal — semua ini sebelum anda sempat mentranskripsikan sepatah pun. Dan itu baru versi apabila tiada apa yang salah.


Di Mana Semua Orang Biasanya Tersekat (Isu Sebenar daripada GitHub dan StackOverflow)

Cari isu pemasangan "openai-whisper" dan anda akan lihat beberapa kegagalan yang sama berulang kali. Ini dipetik terus daripada laporan sebenar, bukan diparafrasa.

"Whisper tidak boleh digunakan pada Python 3.13"

Jika anda memasang Python terkini dari python.org dan bukannya mengunci versi lama melalui Homebrew, pemasangan akan gagal serta-merta:

Getting requirements to build wheel ... error
KeyError: '__version__'

Seperti yang dinyatakan dalam satu jawapan pada thread tersebut dengan jelas: "Whisper tidak boleh digunakan pada Python 3.13 dengan hanya menggunakan versi rantaian dependensinya yang telah dikeluarkan dan disokong." (Sumber: StackOverflow) Penyelesaiannya ialah turunkan versi Python anda dan bina semula virtual environment dari awal — tidak jelas jika anda tidak tahu awal-awal bahawa Whisper sensitif terhadap versi.

"ffmpeg tidak dijumpai" — walaupun selepas memasang ffmpeg

Ini salah satu ralat Whisper paling biasa pada Mac, dan mengelirukan kerana penyelesaiannya kelihatan sepatutnya sudah berjaya:

FileNotFoundError: [Errno 2] No such file or directory: 'ffmpeg': 'ffmpeg'

Pengguna dalam kes ini sudah berjaya menjalankan brew install ffmpeg, memasang semula, malah mencuba wrapper FFmpeg Python — isu sebenar ialah fail binari FFmpeg tidak berada dalam PATH yang boleh dilihat oleh Python. (Sumber: StackOverflow) Untuk mendiagnosis masalah PATH, anda perlu tahu dahulu apa itu PATH.

Mac tiada CUDA — tetapi kebanyakan tutorial menganggap anda ada

Hampir setiap panduan prestasi Whisper membincangkan CUDA, rangka kerja GPU milik NVIDIA. Mac tiada GPU NVIDIA. Apple Silicon menggunakan MPS (Metal Performance Shaders) sebaliknya, dan sokongan MPS dalam PyTorch mempunyai jurang sebenar yang terdokumentasi:

NotImplementedError: The operator 'aten::isin.Tensor_Tensor_out' is not
currently implemented for the MPS device. ... you can set the environment
variable `PYTORCH_ENABLE_MPS_FALLBACK=1` to use the CPU as a fallback for
this op.

Itu ralat sebenar daripada model PyTorch yang berkait rapat dengan Whisper pada Apple Silicon. (Sumber: GitHub — huggingface/transformers #31408) Penyelesaian yang dicadangkan ialah kembali ke CPU untuk operasi tersebut — bermakna pemprosesan lebih perlahan hanya untuk membaiki pepijat yang wujud semata-mata kerana anda menggunakan Mac.

Ralat pengkompil Rust semasa pemasangan

Whisper bergantung pada tokenizer tiktoken milik OpenAI. Jika platform anda tiada wheel siap sedia, pip akan cuba mengkompilasinya daripada source, yang memerlukan toolchain Rust yang berkemungkinan besar belum anda pasang. README rasmi menyatakan perkara ini secara terus: jika pemasangan gagal dengan No module named 'setuptools_rust', anda perlu memasang setuptools-rust secara berasingan, dan mungkin juga persekitaran pembangunan Rust yang lengkap. Itu pemasangan toolchain pengkompil, hanya untuk menjalankan model pertuturan-ke-teks.

Pilihan yang "lebih pantas" memerlukan kompilasi daripada source

Whisper biasa yang berjalan atas PyTorch agak perlahan pada Mac, jadi nasihat biasa ialah beralih kepada whisper.cpp atau mlx-whisper untuk kelajuan sebenar Apple Silicon. Kedua-duanya memang lebih pantas — dan kedua-duanya menukar persediaan Python dengan satu jenis persediaan lain:

git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
./models/download-ggml-model.sh large-v3
./main -m models/ggml-large-v3.bin -f your-audio.wav

Itu bermakna git, toolchain pengkompil C++, dan memuat turun fail model secara manual — jauh sekali daripada "tanpa coding". Dan walaupun anda berjaya mengkompilasinya dengan betul, perkara masih boleh menjadi salah dengan cara yang sungguh sukar dikesan. Seorang pengguna lama menceritakan pengalaman menjalankan sekumpulan fail melalui binari whisper.cpp yang dikompilasinya sendiri pada M4 Mac mini: ia "berfungsi dengan sempurna" pada M1, tetapi pada M4 ia "terus berhenti" menghasilkan output selepas beberapa jam tanpa sebarang ralat, tanpa crash — penyelesaiannya ialah menulis skrip untuk menamatkan dan memulakan semula proses itu setiap jam. ("Whisper terus berjalan, tiada ralat dalam terminal, tiada crash... cuma tiada lagi output.") (Sumber: Ars Technica OpenForum)

Itu bukan kesilapan pemula — itu pengguna berpengalaman yang masih perlu skrip dan cron job untuk mengatasi masalah tersebut.

"Proses pemasangan amat tidak mesra pengguna"

Aduan ini, yang difailkan sebagai isu GitHub terhadap satu alat berasaskan Whisper, merumuskan keseluruhan pengalaman bagi bukan pembangun: "Pemasang amat tidak mesra pengguna, sentiasa mengganggu muat turun fail besar, mengakibatkan pemasangan tidak lengkap dan fail boleh laku yang hilang... bagi mereka yang tiada kemahiran pengaturcaraan, nyahpasang adalah satu-satunya pilihan." (Sumber: GitHub — meizhong986/WhisperJAV #85) Penyelesaian akhir thread itu sendiri, sekali lagi, adalah ketidaksepadanan versi Python — seorang yang tidak dikenali membimbing pelapor langkah demi langkah melalui arahan terminal sehingga berjaya.

Walaupun ia berjaya berjalan, model besar boleh kehabisan memori

Model large-v3 memerlukan kira-kira 10 GB VRAM/unified memory untuk berjalan dengan lancar. Pada MacBook asas 8 GB atau 16 GB, had itu agak ketat sehingga boleh menyebabkan proses terus crash, memaksa anda beralih kepada model yang lebih kecil dan kurang tepat sebagai jalan penyelesaian.


Walaupun Berjaya Berjalan, Whisper Sahaja Bukan Sarikata

Katakan anda berjaya melepasi semua itu dan mendapat arahan whisper your-video.mp4 --model large-v3 yang berfungsi. Apa yang anda perolehi ialah transkrip, bukan sarikata — dan bagi video, itu tugas yang berbeza:

  • Tiada pra-pemprosesan. Whisper menerima audio mentah anda seadanya. Jika ada muzik latar, gema bilik, atau intro yang bising, model itu langsung tidak tahu untuk mengabaikannya — dan ia terkenal serta terdokumentasi bahawa ia berhalusinasi teks (mengulang frasa, mereka dialog) semasa senyap dan bahagian muzik, bukannya mengaku tidak pasti.
  • Masa hanya anggaran. Cap masa terbina dalam Whisper dibundarkan kira-kira ke saat terdekat — cukup baik untuk transkrip, tetapi bukan untuk sarikata yang perlu muncul tepat pada saat seseorang bercakap.
  • Tiada logik pemenggalan baris. Blok teks panjang tanpa henti atau pemisahan janggal di tengah ayat sering berlaku dalam output mentah, dan tiada alat untuk membetulkannya selain membuka fail .srt dengan penyunting teks.
  • Tiada terjemahan. Jika anda memerlukan trek bahasa kedua, itu adalah alat dan aliran kerja yang sama sekali berasingan.
  • Tiada antara muka penyuntingan. Semuanya berlaku pada baris arahan. Tiada waveform, tiada seret-untuk-laras, tiada butang buat asal.

Dengan kata lain, menyelesaikan masalah pemasangan tidak menyelesaikan masalah sarikata. Anda tetap memerlukan alat kedua untuk menukar transkrip kasar menjadi sesuatu yang benar-benar boleh diterbitkan.


Cara Paling Mudah: Langkau Python Sepenuhnya dengan Subtitle Studio

Subtitle Studio menjalankan kelas model Whisper yang sama, tetapi sebagai aplikasi Mac native: muat turun, seret video anda masuk, dan dapatkan sarikata. Tiada terminal, tiada versi Python untuk diuruskan, tiada ralat pip install untuk dinyahpepijat.

Editor Subtitle Studio dengan waveform, senarai sarikata, dan pratonton video yang sejajar dengan pertuturanEditor Subtitle Studio dengan waveform, senarai sarikata, dan pratonton video yang sejajar dengan pertuturan

Selain pemasangan tanpa terminal, ini yang anda perolehi:

  • Model yang ditala untuk Apple Silicon. Model transkripsi dioptimumkan khas untuk cip siri M dengan pecutan Metal — bukan binaan PyTorch generik yang kembali ke CPU untuk operasi MPS yang tidak disokong.
  • Pra-pemprosesan sebelum transkripsi. Pengesanan aktiviti suara (VAD) dan pengurangan bunyi bising membersihkan audio sebelum Whisper melihatnya, jadi muzik latar dan bunyi bising bilik menyebabkan lebih sedikit perkataan tercicir dan lebih sedikit teks halusinasi — itulah kelemahan yang memang terkenal pada Whisper mentah.
  • Penapisan halusinasi. Pemarkahan keyakinan dan analisis aktiviti pertuturan mengesan dan membuang teks fantom yang direka oleh model semasa senyap atau muzik, bukannya terus menghantarnya ke fail sarikata anda.
  • Penjajaran paksa. Selepas transkripsi, penjajar paksa memetakan teks semula ke waveform pada tahap perkataan, menggantikan cap masa Whisper yang dibundarkan ~1 saat dengan masa yang tepat pada tahap bingkai.
  • Pembahagian berasaskan NLP. Transkrip mentah dipecahkan kepada baris sarikata yang mudah dibaca pada sempadan frasa semula jadi, bukannya mengikut jumlah aksara secara sembarangan.
  • Penyuntingan terbina dalam. Seret untuk menyelaraskan semula masa sarikata, memisahkan baris yang terlalu panjang, atau menggabungkan baris yang berpecah — tanpa perlu eksport ke penyunting teks.

Alat selaras semula Subtitle Studio dengan blok sarikata sedang diseret untuk disepadankan dengan waveform audioAlat selaras semula Subtitle Studio dengan blok sarikata sedang diseret untuk disepadankan dengan waveform audio

Panel terjemahan Subtitle Studio dengan pemilih bahasa dan pilihan penyedia AIPanel terjemahan Subtitle Studio dengan pemilih bahasa dan pilihan penyedia AI

Audio dan video anda tidak akan sesekali meninggalkan Mac anda — jaminan privasi yang sama seperti menjalankan Whisper sendiri, cuma tanpa kerumitan persediaan.

Subtitle Studio

Pembelian sekali sahaja. Berjalan sepenuhnya luar talian pada Mac anda.


Whisper CLI vs Subtitle Studio — Perbandingan Sebelah-Menyebelah

OpenAI Whisper (CLI)Subtitle Studio
PersediaanHomebrew, pengurusan versi Python, virtual environment, FFmpeg, pip installMuat turun aplikasi, buka
Coding diperlukanYa — arahan terminal, sesekali nyahpepijat dependensiTidak
Pecutan Apple SiliconBergantung pada sokongan MPS PyTorch (ada jurang)Terbina dalam, model dioptimumkan Metal
Pra-pemprosesan audioTiada — audio mentah dihantar terus kepada modelVAD + pengurangan bunyi bising sebelum transkripsi
Pengendalian halusinasiTiada — output model mentahDikesan dan ditapis secara automatik
Ketepatan cap masaKehalusan ~1 saatPenjajaran paksa pada tahap perkataan
Pemenggalan baris sarikataTiada — perlu dibersihkan secara manualPembahagian automatik berasaskan NLP
Alat penyuntinganPenyunting teks pada fail yang dieksportSelaras semula, pisah, gabung berasaskan waveform
TerjemahanTidak termasukTerbina dalam, luar talian, 25 bahasa
Format output.txt, .srt, .vtt.srt, .fcpxml
KosPercuma (masa anda)Pembelian sekali sahaja

Kesimpulan

Jika anda seorang pembangun yang mahu menskrip Whisper ke dalam satu pipeline, memproses beribu-ribu fail secara kelompok, atau menala halus model itu sendiri, CLI rasmi adalah alat yang betul — fleksibiliti itu memanglah tujuan ia dibina, dan kos persediaannya hanya perlu dibayar sekali.

Jika anda cuma mahu sarikata video yang tepat dan sedia untuk diterbitkan tanpa perlu membuka terminal, laluan tanpa coding membawa anda ke sana dengan lebih pantas: teknologi asas yang sama, tanpa pengurusan persekitaran, ditambah satu set alat khusus sarikata yang memang tidak pernah direka untuk disertakan dalam Whisper mentah.

Subtitle Studio

Tiada Python, tiada Homebrew, tiada terminal. Cuma seret video anda masuk.


Soalan Lazim

Adakah saya perlu tahu Python untuk menjalankan Whisper pada Mac?

Untuk menggunakan pakej rasmi openai-whisper, ya — anda perlu memasang Python, menguruskan virtual environment, dan menjalankan arahan daripada terminal. Jika anda lebih suka tidak menyentuh kod langsung, aplikasi seperti Subtitle Studio menjalankan kelas model yang sama dengan antara muka seret-dan-lepas, tanpa sebarang coding diperlukan.

Kenapa pemasangan Whisper gagal pada Mac saya?

Punca paling biasa ialah: menggunakan versi Python yang tidak disokong (kini 3.13 menyebabkan pemasangan gagal; gunakan 3.10–3.12), FFmpeg tidak berada dalam PATH sistem anda walaupun selepas dipasang, dan ketiadaan pengkompil Rust yang diperlukan untuk membina dependensi tiktoken daripada source. Setiap satu daripada ini menghasilkan mesej ralat yang berbeza dan agak sukar difahami.

Adakah Whisper menggunakan GPU Mac saya?

Boleh, melalui backend MPS (Metal Performance Shaders) milik Apple dalam PyTorch, tetapi sokongan MPS untuk operasi Whisper mempunyai jurang yang terdokumentasi — sesetengah operator tidak dilaksanakan dan secara senyap kembali kepada perlaksanaan CPU yang lebih perlahan. whisper.cpp dan mlx-whisper amnya menggunakan Apple Silicon dengan lebih cekap berbanding pakej Python asal, tetapi kedua-duanya memerlukan kompilasi daripada source.

Apakah perbezaan antara openai-whisper, whisper.cpp, dan mlx-whisper?

openai-whisper ialah pakej Python asal daripada OpenAI — paling mudah dipasang melalui pip, tetapi lebih perlahan pada Apple Silicon kerana ia berjalan melalui backend MPS PyTorch. whisper.cpp ialah pelaksanaan semula C++ yang menggunakan Metal secara terus dan jauh lebih pantas, tetapi anda perlu klon repositori itu dan mengkompilasinya sendiri. mlx-whisper menggunakan rangka kerja MLX milik Apple sendiri dan selalunya menjadi pilihan paling pantas pada cip siri M, dengan persediaan daripada source yang serupa. Ketiga-tiganya tidak menyertakan pra-pemprosesan audio, penyuntingan sarikata, atau terjemahan — ia adalah enjin transkripsi, bukan alat sarikata.

Adakah cara percuma untuk menjalankan Whisper pada Mac tanpa coding?

Model Whisper itu sendiri percuma dan sumber terbuka, tetapi menjalankannya tanpa sebarang persediaan memerlukan aplikasi yang dibungkus, bukannya pustaka Python mentah — seseorang perlu menguruskan pemasangan, pengurusan model, dan antara muka untuk anda. Subtitle Studio ialah aplikasi Mac yang dibina khusus untuk ini: tiada terminal, tiada dependensi untuk diuruskan, pembelian sekali sahaja menggantikan langganan.

Adakah Subtitle Studio menggunakan model Whisper yang sama seperti baris arahan?

Subtitle Studio menggunakan model Whisper yang dioptimumkan dan ditala halus khas untuk jenis audio bercampur yang benar-benar dihadapi oleh pencipta video — dialog bersama muzik, bunyi bising bilik, dan pertuturan pelbagai bahasa — digandingkan dengan pecutan Apple Silicon. Ia dibungkus dalam satu pipeline lengkap (pra-pemprosesan, penapisan halusinasi, penjajaran paksa, pembahagian NLP), bukannya model bebas yang anda perolehi daripada pip install openai-whisper. Lihat perbandingan MacWhisper vs Subtitle Studio kami untuk memahami dengan lebih dekat bagaimana pipeline itu mempengaruhi output sebenar.

Cuba Subtitle Studio Percuma

Beli sekali, tanpa langganan, berjalan sepenuhnya offline di Mac anda.

Muat turun Mac — Percuma