Câu trả lời nhanh: Bản thân mô hình Whisper của OpenAI không phải là một ứng dụng — nó là một thư viện Python mà bạn phải cài đặt và chạy từ terminal, nghĩa là bạn cần Homebrew, đúng phiên bản Python, một virtual environment, FFmpeg, và (thường xuyên) một loạt lỗi dependency trước khi có được bản transcript đầu tiên. Nếu bạn không muốn đụng đến code, cách nhanh nhất để có được trải nghiệm phiên âm riêng tư ngay trên máy là dùng một ứng dụng Mac đã tích hợp sẵn Whisper — như Subtitle Studio — bỏ qua hoàn toàn bước cài đặt và bổ sung thêm các công cụ tiền xử lý, chỉnh sửa mà Whisper thô không có.
Nếu bạn đã tìm "cách chạy Whisper trên Mac" và lạc vào một bài hướng dẫn với sáu bước trước khi bước một thậm chí còn chưa nhắc đến file audio của bạn, thì bạn không hề tưởng tượng ra điều đó. Dưới đây là lý do vì sao lại như vậy, mọi người thường mắc kẹt ở đâu, và giải pháp thay thế không cần code.
OpenAI Whisper Là Gì (Và Vì Sao Nó Không Phải Là Ứng Dụng)
Whisper là mô hình nhận dạng giọng nói mã nguồn mở của OpenAI, ra mắt năm 2022 và liên tục được cập nhật (large-v3, turbo). Nó thực sự xuất sắc — chính xác trên hơn 90 ngôn ngữ, miễn phí sử dụng, và chạy hoàn toàn trên máy của bạn mà không cần tải lên bất kỳ đoạn audio nào. Đó chính là lý do vì sao nhiều người muốn tự mình chạy nó.
Trang GitHub repository của openai/whisper — 106k sao nhưng chỉ là một kho mã nguồn, không có nút tải xuống, không có trình cài đặt, không có ứng dụng nào để mở
Hãy để ý xem trang đó thiếu những gì: nút tải xuống, trình cài đặt, biểu tượng ứng dụng. Thứ bạn nhận được là một thư mục mã nguồn Python — 106.000 người đã gắn sao cho repository này, nhưng việc gắn sao không cài đặt bất cứ thứ gì lên Mac của bạn.
Nhưng kho GitHub này là một codebase nghiên cứu, không phải sản phẩm dành cho người dùng cuối. Hướng dẫn cài đặt chính thức mặc định rằng bạn đã quen thuộc với:
- Cài đặt và quản lý nhiều phiên bản Python
- Sử dụng
pipvà virtual environment - Đọc hiểu traceback lỗi của Python khi có sự cố
- Cài đặt riêng một dependency hệ thống (FFmpeg) tách biệt với chính mô hình
Không có gì trong số đó là quá đáng đối với một nhà nghiên cứu machine learning. Nhưng đó lại là một đòi hỏi quá lớn với một người chỉ muốn có phụ đề cho video YouTube ngay tối nay.
Cách "Chính Thức" Để Chạy Whisper Trên Mac, Từng Bước Một
Công bằng mà nói, đội ngũ Whisper viết README rất tốt. Dưới đây là những gì thực sự cần làm để đi từ "chưa cài gì cả" đến "có transcript hiện trên màn hình."
Bước 1: Cài đặt Homebrew
Nếu bạn chưa có trình quản lý gói không chính thức của Apple, đây là thứ cần cài đầu tiên:
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
Bước 2: Cài đặt phiên bản Python tương thích
Chuỗi dependency của Whisper (numba, tiktoken, PyTorch) không hỗ trợ các phiên bản Python mới nhất. Tính đến thời điểm viết bài này, Python 3.13 làm hỏng quá trình cài đặt — bạn cần 3.10, 3.11, hoặc 3.12:
brew install python@3.11
Bước 3: Tạo virtual environment
Để tránh các dependency của Whisper xung đột với những thứ khác trên hệ thống, cách được khuyến nghị là dùng một môi trường cô lập:
python3.11 -m venv whisper-env
source whisper-env/bin/activate
Bước 4: Cài đặt FFmpeg
Whisper tự bản thân nó không giải mã audio — nó gọi ra FFmpeg, một phần mềm phải cài riêng:
brew install ffmpeg
Bước 5: Cài đặt Whisper
pip install -U openai-whisper
Bước 6: Chạy bản phiên âm đầu tiên
whisper your-audio.mp3 --model turbo
Sáu bước, ba trình cài đặt riêng biệt, một giới hạn về phiên bản Python mà bạn phải biết trước — và bạn vẫn chưa phiên âm được lấy một từ. Và đó là phiên bản khi mọi thứ diễn ra suôn sẻ.
Mọi Người Thường Mắc Kẹt Ở Đâu (Các Vấn Đề Thực Tế Từ GitHub Và StackOverflow)
Tìm kiếm các vấn đề khi cài đặt "openai-whisper," bạn sẽ thấy cùng một nhóm nhỏ lỗi lặp đi lặp lại. Những trích dẫn dưới đây được lấy trực tiếp từ các báo cáo thực tế, không diễn giải lại.
"Whisper không thể dùng trên Python 3.13"
Nếu bạn cài phiên bản Python mới nhất từ python.org thay vì cố định một phiên bản cũ hơn bằng Homebrew, quá trình cài đặt sẽ thất bại ngay lập tức:
Getting requirements to build wheel ... error
KeyError: '__version__'
Như một câu trả lời trong chủ đề đó nói thẳng: "Whisper không thể sử dụng trên Python 3.13 nếu chỉ dùng các phiên bản đã phát hành, được hỗ trợ trong chuỗi dependency của nó." (Nguồn: StackOverflow) Cách khắc phục là hạ phiên bản Python xuống và xây dựng lại virtual environment từ đầu — điều không hề rõ ràng nếu bạn chưa biết trước rằng Whisper nhạy cảm với phiên bản.
"Không tìm thấy ffmpeg" — ngay cả sau khi đã cài ffmpeg
Đây là một trong những lỗi Whisper phổ biến nhất trên Mac, và nó gây bối rối chính vì cách khắc phục trông như thể lẽ ra đã phải hoạt động rồi:
FileNotFoundError: [Errno 2] No such file or directory: 'ffmpeg': 'ffmpeg'
Người dùng trong trường hợp này đã chạy thành công brew install ffmpeg, cài lại lần nữa, thậm chí còn thử một wrapper Python cho FFmpeg — vấn đề thực sự là file thực thi của FFmpeg không nằm trong PATH mà Python có thể nhìn thấy. (Nguồn: StackOverflow) Để chẩn đoán được lỗi PATH, trước tiên bạn phải biết PATH là gì.
Mac không có CUDA — nhưng hầu hết các hướng dẫn đều mặc định là có
Gần như mọi hướng dẫn về hiệu năng của Whisper đều nói về CUDA, framework GPU của NVIDIA. Mac không có GPU NVIDIA. Apple Silicon dùng MPS (Metal Performance Shaders) thay thế, và sự hỗ trợ MPS trong PyTorch có những lỗ hổng thực sự, đã được ghi nhận:
NotImplementedError: The operator 'aten::isin.Tensor_Tensor_out' is not
currently implemented for the MPS device. ... you can set the environment
variable `PYTORCH_ENABLE_MPS_FALLBACK=1` to use the CPU as a fallback for
this op.
Đó là lỗi thực tế từ một mô hình PyTorch có liên quan đến Whisper trên Apple Silicon. (Nguồn: GitHub — huggingface/transformers #31408) Cách khắc phục được đề xuất là chuyển phép toán đó về CPU — nghĩa là xử lý chậm hơn chỉ để sửa một lỗi vốn chỉ tồn tại vì bạn đang dùng Mac.
Lỗi trình biên dịch Rust khi cài đặt
Whisper phụ thuộc vào bộ tokenizer tiktoken của OpenAI. Nếu nền tảng của bạn không có sẵn wheel đã dựng sẵn, pip sẽ cố biên dịch nó từ mã nguồn, việc này cần một bộ công cụ Rust mà có lẽ bạn chưa cài. README chính thức nói thẳng về vấn đề này: nếu cài đặt thất bại với lỗi No module named 'setuptools_rust', bạn cần cài riêng setuptools-rust, và có thể cả môi trường phát triển Rust đầy đủ. Phải cài cả một bộ công cụ biên dịch, chỉ để chạy một mô hình chuyển giọng nói thành văn bản.
Các Tùy Chọn "Nhanh Hơn" Yêu Cầu Biên Dịch Từ Mã Nguồn
Whisper thuần chạy trên PyTorch chậm rõ rệt trên Mac, nên lời khuyên phổ biến là chuyển sang whisper.cpp hoặc mlx-whisper để tận dụng tốc độ thực sự của Apple Silicon. Cả hai đều nhanh hơn — và cả hai đều đánh đổi việc cài đặt Python bằng một kiểu cài đặt khác:
git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
./models/download-ggml-model.sh large-v3
./main -m models/ggml-large-v3.bin -f your-audio.wav
Đó là git, một bộ công cụ biên dịch C++, và tải mô hình bằng tay — không hề "không cần code" chút nào. Và ngay cả sau khi biên dịch đúng cách, mọi thứ vẫn có thể trục trặc theo những cách thực sự khó gỡ lỗi. Một người dùng lâu năm đã mô tả việc chạy một loạt file qua một bản whisper.cpp tự biên dịch trên M4 Mac mini: nó "chạy hoàn toàn ổn" trên M1, nhưng trên M4 thì "chỉ đơn giản là dừng lại" không cho ra output nữa sau vài giờ, không lỗi, không sập — và cách khắc phục là viết một script để tắt và khởi động lại tiến trình mỗi giờ. ("Whisper vẫn đang chạy, không có lỗi nào trong terminal, không sập... chỉ là không còn output nữa.") (Nguồn: Ars Technica OpenForum)
Đó không phải là lỗi của người mới bắt đầu — đó là một người dùng dày dạn kinh nghiệm vẫn vấp phải bức tường cần đến một script và một cron job để vượt qua.
"Quá Trình Cài Đặt Cực Kỳ Khó Chịu"
Lời phàn nàn này, được nộp dưới dạng một GitHub issue nhắm vào một công cụ dựa trên Whisper, tóm gọn toàn bộ trải nghiệm của những người không phải lập trình viên: "Trình cài đặt cực kỳ khó chịu, liên tục làm gián đoạn việc tải các file lớn, dẫn đến cài đặt không hoàn chỉnh và thiếu file thực thi... Với những ai không có kỹ năng lập trình, gỡ cài đặt là lựa chọn duy nhất." (Nguồn: GitHub — meizhong986/WhisperJAV #85) Cách giải quyết của chính chủ đề đó, một lần nữa, lại là do không khớp phiên bản Python — một người lạ đã hướng dẫn từng lệnh terminal cho người báo cáo cho đến khi nó hoạt động.
Ngay Cả Khi Chạy Được, Các Mô Hình Lớn Vẫn Có Thể Hết Bộ Nhớ
Mô hình large-v3 cần khoảng 10 GB VRAM/bộ nhớ hợp nhất để chạy trơn tru. Trên một chiếc MacBook cơ bản 8 GB hoặc 16 GB, con số đó đủ eo hẹp để khiến tiến trình sập hoàn toàn, buộc bạn phải hạ xuống một mô hình nhỏ hơn, kém chính xác hơn để làm giải pháp tạm.
Ngay Cả Khi Chạy Được, Whisper Một Mình Vẫn Không Phải Là Phụ Đề
Giả sử bạn đã vượt qua tất cả những điều trên và có được lệnh whisper your-video.mp4 --model large-v3 hoạt động. Thứ bạn nhận lại là một bản transcript, không phải phụ đề — và với video, đó là một công việc khác:
- Không tiền xử lý. Whisper nhận audio gốc y nguyên như vậy. Nếu có nhạc nền, tiếng vọng trong phòng, hay đoạn mở đầu ồn ào, mô hình hoàn toàn không biết để bỏ qua chúng — và nó được ghi nhận rõ ràng là hay "ảo giác" ra văn bản (lặp lại cụm từ, bịa ra lời thoại) trong lúc im lặng hoặc có nhạc nền thay vì thừa nhận sự không chắc chắn.
- Thời gian chỉ mang tính tương đối. Timestamp tích hợp sẵn của Whisper được làm tròn xấp xỉ đến giây gần nhất — ổn cho một bản transcript, nhưng không ổn cho một dòng phụ đề cần xuất hiện chính xác vào lúc ai đó nói.
- Không có logic ngắt dòng. Các khối văn bản dài dằng dặc hoặc bị cắt ngang câu một cách khó chịu là chuyện thường thấy trong output thô, và không có công cụ nào để sửa ngoài việc mở file
.srtbằng trình soạn thảo văn bản. - Không có bản dịch. Nếu bạn cần một track ngôn ngữ thứ hai, đó là một công cụ và quy trình hoàn toàn khác.
- Không có giao diện chỉnh sửa. Mọi thứ diễn ra trên dòng lệnh. Không có waveform, không có kéo-để-chỉnh, không có nút hoàn tác.
Nói cách khác, giải quyết được vấn đề cài đặt không có nghĩa là giải quyết được vấn đề phụ đề. Bạn vẫn cần một công cụ thứ hai để biến một bản transcript thô thành thứ mà bạn thực sự muốn xuất bản.
Cách Dễ Nhất: Bỏ Qua Python Hoàn Toàn Với Subtitle Studio
Subtitle Studio chạy cùng dòng mô hình Whisper, nhưng dưới dạng một ứng dụng Mac native: tải về, kéo video vào, và nhận lại phụ đề. Không terminal, không phiên bản Python phải quản lý, không pip install phải gỡ lỗi.
Trình chỉnh sửa Subtitle Studio với waveform, danh sách phụ đề, và bản xem trước video được căn khớp với lời nói
Bên cạnh việc cài đặt không cần terminal, bạn còn nhận được:
- Mô hình tối ưu cho Apple Silicon. Mô hình phiên âm được tối ưu hóa riêng cho các chip dòng M với tăng tốc Metal — không phải một bản dựng PyTorch chung chung phải chuyển về CPU khi gặp các phép toán MPS không được hỗ trợ.
- Tiền xử lý trước khi phiên âm. Phát hiện hoạt động giọng nói (VAD) và giảm nhiễu làm sạch audio trước khi Whisper thấy nó, nên nhạc nền và tiếng ồn phòng gây ra ít từ bị mất và ít văn bản ảo giác hơn — chính là kiểu lỗi mà Whisper thô nổi tiếng mắc phải.
- Lọc ảo giác. Chấm điểm độ tin cậy và phân tích hoạt động giọng nói phát hiện và loại bỏ văn bản "ma" mà mô hình bịa ra trong lúc im lặng hoặc có nhạc, thay vì chuyển thẳng nó vào file phụ đề của bạn.
- Căn chỉnh cưỡng bức (forced alignment). Sau khi phiên âm, một bộ căn chỉnh cưỡng bức ánh xạ văn bản trở lại waveform ở cấp độ từng từ, thay thế các timestamp làm tròn ~1 giây của Whisper bằng thời gian chính xác đến từng khung hình.
- Phân đoạn dựa trên NLP. Bản transcript thô được chia thành các dòng phụ đề dễ đọc tại các ranh giới cụm từ tự nhiên, thay vì theo số ký tự tùy tiện.
- Chỉnh sửa tích hợp sẵn. Kéo để căn chỉnh lại thời gian của một dòng phụ đề, tách một dòng quá dài, hoặc gộp các đoạn bị vỡ vụn — không cần xuất ra trình soạn thảo văn bản.
Công cụ căn chỉnh lại của Subtitle Studio với một khối phụ đề đang được kéo để khớp với waveform audio
- Dịch ngay trên thiết bị. Dịch phụ đề đã hoàn thiện của bạn sang 25 ngôn ngữ, hoàn toàn ngoại tuyến, không cần API key và không tốn phí theo từng từ — xem bài phân tích chuyên sâu về dịch offline của chúng tôi để biết mô hình cục bộ hoạt động như thế nào.
Bảng dịch của Subtitle Studio với bộ chọn ngôn ngữ và các tùy chọn nhà cung cấp AI
Audio và video của bạn không bao giờ rời khỏi Mac — cùng một cam kết về quyền riêng tư như khi bạn tự chạy Whisper, chỉ trừ đi phần cài đặt.
Subtitle Studio
Mua một lần. Chạy hoàn toàn ngoại tuyến trên Mac của bạn.
Whisper CLI So Với Subtitle Studio — So Sánh Trực Tiếp
| OpenAI Whisper (CLI) | Subtitle Studio | |
|---|---|---|
| Cài đặt | Homebrew, quản lý phiên bản Python, virtual environment, FFmpeg, pip install | Tải ứng dụng về, mở lên |
| Cần biết code | Có — lệnh terminal, thỉnh thoảng phải gỡ lỗi dependency | Không |
| Tăng tốc Apple Silicon | Phụ thuộc vào mức hỗ trợ MPS của PyTorch (còn lỗ hổng) | Tích hợp sẵn, mô hình tối ưu cho Metal |
| Tiền xử lý audio | Không — audio gốc được đưa thẳng vào mô hình | VAD + giảm nhiễu trước khi phiên âm |
| Xử lý ảo giác | Không — output thô của mô hình | Tự động phát hiện và lọc |
| Độ chính xác timestamp | Độ chi tiết ~1 giây | Căn chỉnh cưỡng bức ở cấp độ từng từ |
| Ngắt dòng phụ đề | Không — cần dọn dẹp thủ công | Phân đoạn tự động dựa trên NLP |
| Công cụ chỉnh sửa | Trình soạn thảo văn bản trên file đã xuất | Căn chỉnh, tách, gộp dựa trên waveform |
| Dịch thuật | Không có | Tích hợp sẵn, ngoại tuyến, 25 ngôn ngữ |
| Định dạng output | .txt, .srt, .vtt | .srt, .fcpxml |
| Chi phí | Miễn phí (thời gian của bạn) | Mua một lần |
Kết Luận
Nếu bạn là một lập trình viên muốn viết script tích hợp Whisper vào một pipeline, xử lý hàng loạt hàng nghìn file, hoặc tự fine-tune mô hình, công cụ CLI chính thức là lựa chọn đúng đắn — sự linh hoạt đó chính là mục đích nó được tạo ra, và chi phí cài đặt chỉ phải trả một lần duy nhất.
Nếu bạn chỉ muốn có phụ đề chính xác, sẵn sàng để xuất bản cho một video mà không cần mở terminal, con đường không cần code sẽ đưa bạn đến đích nhanh hơn: cùng một công nghệ nền tảng, không cần quản lý môi trường, cùng một bộ công cụ chuyên biệt cho phụ đề mà Whisper thô chưa bao giờ được thiết kế để bao gồm.
Subtitle Studio
Không cần Python, không cần Homebrew, không cần terminal. Chỉ cần kéo video vào.
Câu Hỏi Thường Gặp
Tôi có cần biết Python để chạy Whisper trên Mac không?
Để dùng package openai-whisper chính thức, câu trả lời là có — bạn sẽ cần cài Python, quản lý một virtual environment, và chạy lệnh từ terminal. Nếu bạn không muốn đụng đến code, các ứng dụng như Subtitle Studio chạy cùng dòng mô hình với giao diện kéo-thả và không cần biết lập trình.
Vì sao Whisper cài đặt thất bại trên Mac của tôi?
Nguyên nhân phổ biến nhất là: dùng phiên bản Python không được hỗ trợ (hiện tại 3.13 làm hỏng cài đặt; hãy dùng 3.10–3.12), FFmpeg không nằm trong PATH của hệ thống dù đã được cài đặt, và thiếu trình biên dịch Rust cần thiết để build dependency tiktoken từ mã nguồn. Mỗi nguyên nhân sẽ sinh ra một thông báo lỗi khác nhau và khá khó hiểu.
Whisper có dùng GPU trên Mac của tôi không?
Có thể, thông qua backend MPS (Metal Performance Shaders) của Apple trong PyTorch, nhưng sự hỗ trợ MPS cho các phép toán của Whisper vẫn còn những lỗ hổng đã được ghi nhận — một số toán tử chưa được triển khai và âm thầm chuyển về thực thi chậm hơn trên CPU. whisper.cpp và mlx-whisper nhìn chung tận dụng Apple Silicon hiệu quả hơn so với package Python gốc, nhưng cả hai đều yêu cầu biên dịch từ mã nguồn.
Sự khác biệt giữa openai-whisper, whisper.cpp, và mlx-whisper là gì?
openai-whisper là package Python gốc của OpenAI — dễ cài đặt nhất qua pip, nhưng chậm hơn trên Apple Silicon vì nó chạy qua backend MPS của PyTorch. whisper.cpp là bản viết lại bằng C++ sử dụng Metal trực tiếp và nhanh hơn đáng kể, nhưng bạn phải tự clone repository và biên dịch nó. mlx-whisper dùng framework MLX riêng của Apple và thường là lựa chọn nhanh nhất trên các chip dòng M, với kiểu cài đặt từ mã nguồn tương tự. Không cái nào trong ba cái này có tiền xử lý audio, chỉnh sửa phụ đề, hay dịch thuật — chúng là các engine phiên âm, không phải công cụ phụ đề.
Có cách nào miễn phí để chạy Whisper trên Mac mà không cần code không?
Bản thân mô hình Whisper là miễn phí và mã nguồn mở, nhưng để chạy nó mà không cần cài đặt gì, bạn cần một ứng dụng đã được đóng gói thay vì thư viện Python thô — phải có ai đó xử lý việc cài đặt, quản lý mô hình, và giao diện thay bạn. Subtitle Studio là một ứng dụng Mac được xây dựng riêng cho việc này: không terminal, không dependency phải quản lý, mua một lần thay vì trả phí theo tháng.
Subtitle Studio có dùng cùng mô hình Whisper như dòng lệnh không?
Subtitle Studio dùng một mô hình Whisper đã được tối ưu hóa, fine-tune riêng cho loại audio hỗn hợp mà các nhà sáng tạo video thực sự làm việc cùng — lời thoại chồng lên nhạc, tiếng ồn phòng, và giọng nói đa ngôn ngữ — kết hợp với tăng tốc Apple Silicon. Nó được bọc trong một pipeline đầy đủ (tiền xử lý, lọc ảo giác, căn chỉnh cưỡng bức, phân đoạn NLP) thay vì mô hình độc lập mà bạn sẽ nhận được từ pip install openai-whisper. Xem bài so sánh MacWhisper và Subtitle Studio của chúng tôi để hiểu rõ hơn pipeline đó ảnh hưởng thế nào đến kết quả thực tế.
Dùng thử Subtitle Studio miễn phí
Mua một lần, không đăng ký, hoạt động hoàn toàn offline trên Mac của bạn.

