すべての記事
Whispermac使い方no-codeopenai字幕

Macで一番簡単にOpenAI Whisperを使う方法(コード不要)

OpenAI Whisperは無料で高精度ですが、Macで動かすにはPython、Homebrew、FFmpeg、そして大量のターミナルエラーが待っています。コードを一切書かずに同じ文字起こしを実現する方法を紹介します。

·Tom Mong
Macでダウンロード — 無料
Macで一番簡単にOpenAI Whisperを使う方法(コード不要)

先に結論: OpenAIのWhisperモデルそのものはアプリではありません。ターミナルからインストールして実行するPythonライブラリなので、Homebrew、正しいバージョンのPython、仮想環境、FFmpegを揃え、たいてい依存関係のエラーの山を乗り越えてから、ようやく最初の文字起こしにたどり着きます。コードを書きたくないなら、同じくデバイス内で完結するプライベートな文字起こしを最速で手に入れる方法は、Whisperをあらかじめ組み込んだMacアプリ——例えばSubtitle Studio——を使うことです。セットアップを丸ごとスキップできるうえ、生のWhisperにはない前処理や編集機能まで付いてきます。

「Mac Whisper 使い方」で検索して開いた記事が、肝心の音声ファイルの話に入る前に6つも手順を並べていた——そんな経験があるなら、それは気のせいではありません。なぜそうなるのか、どこでつまずく人が多いのか、そしてコード不要の代替手段を順番に見ていきましょう。


OpenAI Whisperとは何か(そしてなぜアプリではないのか)

Whisperは、OpenAIが2022年に公開し、その後もlarge-v3やturboなど更新を続けているオープンソースの音声認識モデルです。90以上の言語に対応する精度の高さもさることながら、無料で使えて、しかも音声をどこにもアップロードせず自分のマシン上だけで完結します。だからこそ「自分の手で動かしてみたい」と考える人が後を絶ちません。

openai/whisperのGitHubリポジトリ。スター数は10.6万だが、ダウンロードボタンもインストーラーもなく、開けるアプリも存在しないソースコードのリポジトリopenai/whisperのGitHubリポジトリ。スター数は10.6万だが、ダウンロードボタンもインストーラーもなく、開けるアプリも存在しないソースコードのリポジトリ

このページに何がないか、注目してみてください。ダウンロードボタンも、インストーラーも、アプリのアイコンもありません。手に入るのはPythonのソースコード一式だけ——10万6千人がこのリポジトリにスターを付けていますが、スターを付けたところでMacに何かがインストールされるわけではないのです。

このGitHubリポジトリはあくまで研究用のコードベースであって、一般消費者向けの製品ではありません。公式のセットアップ手順は、次のようなことに抵抗がない人を前提にしています。

  • 複数のPythonバージョンをインストールし、使い分ける
  • pipと仮想環境を使いこなす
  • 何かが壊れたときにPythonのトレースバックを読み解く
  • モデル本体とは別に、システム側の依存パッケージ(FFmpeg)をインストールする

機械学習の研究者にとってはどれも当たり前の要求です。でも、今夜中にYouTube動画の字幕を用意したいだけの人にとっては、かなりハードルが高いと言わざるを得ません。


「公式」の手順でMacにWhisperを入れる全ステップ

公平を期すために言っておくと、WhisperのREADME自体はよく書かれています。「何もインストールされていない状態」から「画面に文字起こし結果が表示される」まで、実際に必要な作業を順に見ていきましょう。

ステップ1: Homebrewをインストールする

Appleの非公式パッケージマネージャーをまだ持っていなければ、まずこれをインストールします。

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

ステップ2: 対応するPythonのバージョンをインストールする

Whisperの依存関係チェーン(numbatiktoken、PyTorch)は最新のPythonをサポートしていません。本記事執筆時点では、Python 3.13だとインストールが失敗します。3.10、3.11、3.12のいずれかが必要です。

brew install python@3.11

ステップ3: 仮想環境を作る

Whisperの依存パッケージがシステム上の他のものと衝突しないよう、独立した環境を用意するのが推奨手順です。

python3.11 -m venv whisper-env
source whisper-env/bin/activate

ステップ4: FFmpegをインストールする

Whisper自体には音声をデコードする機能がなく、FFmpegを外部から呼び出します。これも別途インストールが必要です。

brew install ffmpeg

ステップ5: Whisperをインストールする

pip install -U openai-whisper

ステップ6: 最初の文字起こしを実行する

whisper your-audio.mp3 --model turbo

6つの手順、3つの独立したインストーラー、そして事前に知っておかなければならなかったPythonのバージョン制約——ここまでで、まだ一文字も文字起こしできていません。しかもこれは、何もトラブルが起きなかった場合の話です。


みんながつまずくポイント(GitHubとStackOverflowの実例から)

「openai-whisper install」のトラブルを検索すると、いつも同じような失敗パターンが繰り返し出てきます。以下は実際の報告からそのまま引用したもので、言い換えはしていません。

「WhisperはPython 3.13では使えない」

Homebrewで古いバージョンを指定せず、python.orgから最新のPythonをインストールすると、その場でインストールが失敗します。

Getting requirements to build wheel ... error
KeyError: '__version__'

あるスレッドの回答は端的にこう述べています。「現時点で公開・サポートされているバージョンの依存関係チェーンだけを使う限り、WhisperはPython 3.13では動かせない」(出典: StackOverflow)。解決策はPythonのバージョンを下げて仮想環境を作り直すことですが、Whisperがバージョンに敏感だと事前に知らなければ、まず気づけません。

ffmpegをインストールしたはずなのに「ffmpeg not found」

これはMacで最も頻出するWhisperのエラーの一つで、厄介なのは「やるべきことはやったはずなのに」直らないように見える点です。

FileNotFoundError: [Errno 2] No such file or directory: 'ffmpeg': 'ffmpeg'

このケースの投稿者はすでにbrew install ffmpegを成功させ、再インストールもし、PythonのFFmpegラッパーまで試していました。実際の原因は、FFmpegの実行ファイルがPythonから見えるPATH上になかったことです(出典: StackOverflow)。PATHの問題を突き止めるには、そもそもPATHが何かを知っている必要があります。

MacにはCUDAがない——なのに多くのチュートリアルはCUDA前提

Whisperの高速化に関するチュートリアルのほとんどは、NVIDIAのGPUフレームワークであるCUDAについて語ります。しかしMacにNVIDIAのGPUは搭載されていません。Apple Siliconが使うのはMPS(Metal Performance Shaders)で、PyTorchのMPSサポートには実際に記録が残っているような穴があります。

NotImplementedError: The operator 'aten::isin.Tensor_Tensor_out' is not
currently implemented for the MPS device. ... you can set the environment
variable `PYTORCH_ENABLE_MPS_FALLBACK=1` to use the CPU as a fallback for
this op.

これはApple Silicon上で、Whisperに近いPyTorchモデルが実際に出したエラーです(出典: GitHub — huggingface/transformers #31408)。提案されている回避策は、その処理だけCPUにフォールバックさせるというもの——つまり、Macを使っているという理由だけで生まれたバグを直すために、処理速度を犠牲にすることになります。

インストール中にRustコンパイラのエラーが出る

WhisperはOpenAI製のトークナイザーtiktokenに依存しています。お使いの環境向けに用意済みのwheelファイルがない場合、pipはソースコードからのビルドを試み、そのためにはおそらく入っていないRustのツールチェーンが必要になります。公式のREADMEもこの点に正面から触れていて、No module named 'setuptools_rust'というエラーが出た場合は、setuptools-rustを別途インストールし、場合によってはRustの開発環境一式まで入れる必要があるとされています。音声をテキストに変換したいだけなのに、コンパイラのツールチェーンをインストールする羽目になるわけです。

「より高速な」選択肢はソースからのビルドが必要

PyTorch版のプレーンなWhisperはMacだと目に見えて遅いため、Apple Siliconの実力を引き出すにはwhisper.cppmlx-whisperへの乗り換えがよく勧められます。どちらも確かに高速ですが、その代償としてPythonのセットアップが別種のセットアップに置き換わるだけです。

git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
./models/download-ggml-model.sh large-v3
./main -m models/ggml-large-v3.bin -f your-audio.wav

git、C++のコンパイラ環境、そしてモデルファイルの手動ダウンロード——とても「コード不要」とは言えません。しかも正しくビルドできたあとでさえ、原因を突き止めるのが本当に難しいトラブルに見舞われることがあります。あるベテランユーザーは、M4搭載のMac miniで自前ビルドしたwhisper.cppのバイナリを使って大量のファイルをバッチ処理したところ、M1では「まったく問題なく動く」のに、M4では数時間走らせるとエラーもクラッシュもなく「突然出力が止まる」現象に見舞われたと報告しています。対処法は、1時間おきにプロセスを強制終了して再起動するスクリプトを書くことでした。(「Whisperは動き続けているし、ターミナルにエラーは出ないし、クラッシュもしていない……ただ、それ以上の出力が一切なくなるんだ」)(出典: Ars Technica OpenForum)

これは初心者のミスではありません。経験豊富なユーザーでさえ、スクリプトとcronジョブで回避するしかない壁にぶつかったということです。

「インストールプロセスが極めて不親切」

これはWhisperベースのツールに対してGitHub issueとして寄せられた不満で、非エンジニアの体験を端的にまとめています。「インストーラーが極めて不親切で、大きなファイルのダウンロードが何度も途中で中断され、インストールが不完全になり、実行ファイルが欠けたままになる……プログラミングの知識がない人にとって、残された選択肢はアンインストールしかない」(出典: GitHub — meizhong986/WhisperJAV #85)。このスレッドの解決策も、結局はPythonのバージョンの不一致で、見知らぬ第三者が投稿者にターミナルの操作を一つひとつ教えることで、ようやく解決しました。

動いたとしても、大きいモデルはメモリ不足になりうる

large-v3モデルを快適に動かすには、VRAM/統合メモリが約10GB必要です。標準構成の8GBや16GBのMacBookでは、これはかなりぎりぎりのラインで、処理が丸ごとクラッシュしてしまうこともあり、その場合は精度の低い小さなモデルに落とすしかありません。


動いたとしても、Whisper単体では字幕にならない

ここまでの壁をすべて乗り越え、whisper your-video.mp4 --model large-v3が無事に動いたとしましょう。それでも手に入るのは文字起こしであって、字幕ではありません。動画の場合、これはまったく別の作業です。

  • 前処理がない。 Whisperは音声を生のまま受け取ります。背景音楽や部屋の反響、うるさいイントロがあってもモデルはそれを無視するすべを知らず、しかも無音区間や音楽のパートで幻覚(同じフレーズの繰り返しや存在しないセリフの捏造)を起こしやすいことがよく知られています。分からないと正直に言うのではなく、それらしい文章を作ってしまうのです。
  • タイミングはあくまで近似値。 Whisperが内部で持つタイムスタンプはおおよそ1秒単位に丸められています。文字起こしとしては十分でも、話し始めた瞬間にぴったり表示されるべき字幕としては不十分です。
  • 改行のロジックがない。 生の出力には長すぎる一続きの塊や、文の途中で不自然に切れる区切りがよく現れますが、.srtをテキストエディタで開いて手作業で直す以外に手立てはありません。
  • 翻訳機能がない。 第2言語のトラックが必要なら、それはまったく別のツールと工程の話です。
  • 編集用のインターフェースがない。 すべてがコマンドラインで完結します。波形表示もなければ、ドラッグでの調整も、元に戻すボタンもありません。

つまり、インストールの問題を解決したからといって、字幕の問題が解決するわけではないのです。結局、粗い文字起こしを実際に公開できる形にするために、もう一つ別のツールが必要になります。


一番簡単な方法: Pythonを丸ごとスキップできるSubtitle Studio

Subtitle Studioは同系統のWhisperモデルを使いながら、ネイティブのMacアプリとして動きます。ダウンロードして、動画をドラッグするだけで字幕が返ってきます。ターミナルもPythonのバージョン管理も、pip installのデバッグも一切必要ありません。

波形、字幕リスト、音声に合わせた動画プレビューが揃ったSubtitle Studioエディター波形、字幕リスト、音声に合わせた動画プレビューが揃ったSubtitle Studioエディター

ターミナル操作なしのインストールに加えて、次のようなものが手に入ります。

  • Apple Silicon向けに調整されたモデル。 文字起こしモデルはM系チップとMetalアクセラレーションに特化してチューニングされており、MPS未対応の演算のたびにCPUへフォールバックする汎用PyTorchビルドとは違います。
  • 文字起こし前の前処理。 音声区間検出(VAD)とノイズ除去がWhisperに渡す前に音声をクリーンアップするので、背景音楽や部屋の雑音による単語の脱落や幻覚テキストが大幅に減ります。これはまさに生のWhisperが弱点とする失敗パターンです。
  • 幻覚のフィルタリング。 信頼度スコアと発話区間の分析によって、モデルが無音や音楽の区間で捏造した幽霊のようなテキストを検出・除去してから字幕ファイルに反映します。
  • 強制アライメント。 文字起こしの後、フォーストアライナーがテキストを単語レベルで波形に対応付け直し、Whisperの約1秒単位に丸められたタイムスタンプを、フレーム単位の正確なタイミングに置き換えます。
  • NLPベースのセグメンテーション。 生の文字起こしは、任意の文字数で機械的に切るのではなく、自然な句読点の切れ目で読みやすい字幕行に分割されます。
  • 編集機能を内蔵。 字幕のタイミングをドラッグで調整したり、長すぎる行を分割したり、断片化した行を結合したり——テキストエディタに書き出す必要はありません。

Subtitle Studioの再アライメントツール。字幕ブロックを音声波形に合わせてドラッグしている様子Subtitle Studioの再アライメントツール。字幕ブロックを音声波形に合わせてドラッグしている様子

  • 端末内での翻訳。 完成した字幕を25言語に、完全オフラインで、APIキーも従量課金も一切なしで翻訳できます。ローカルモデルの仕組みについてはオフライン翻訳の詳細解説をご覧ください。

Subtitle Studioの翻訳パネル。言語選択とAIプロバイダーのオプションを表示Subtitle Studioの翻訳パネル。言語選択とAIプロバイダーのオプションを表示

音声も動画もMacから外に出ることは一切ありません。自分でWhisperを動かすのと同じプライバシー保証を、セットアップの手間なしで得られます。

Subtitle Studio

買い切り。Mac上で完全にオフライン動作します。


Whisper CLI vs Subtitle Studio 徹底比較

OpenAI Whisper(CLI)Subtitle Studio
セットアップHomebrew、Pythonバージョン管理、仮想環境、FFmpeg、pip installアプリをダウンロードして開くだけ
コーディングの要否必要——ターミナル操作、依存関係のデバッグも時々発生不要
Apple Silicon対応PyTorchのMPSサポート次第(未対応箇所あり)内蔵、Metal最適化済みモデル
音声の前処理なし——生の音声をそのままモデルへ文字起こし前にVAD+ノイズ除去
幻覚への対応なし——モデルの生出力そのまま自動で検出・除去
タイムスタンプの精度約1秒単位単語レベルの強制アライメント
字幕の改行処理なし——手作業での整形が必要自動のNLPベース分割
編集ツール書き出したファイルをテキストエディタで編集波形ベースの再アライメント・分割・結合
翻訳機能非搭載内蔵、オフライン、25言語対応
出力形式.txt.srt.vtt.srt.fcpxml
費用無料(その代わり自分の時間)買い切り

結論

Whisperをパイプラインに組み込んで自動化したい、何千ものファイルをバッチ処理したい、あるいはモデル自体をファインチューニングしたい——そんな開発者なら、公式CLIが正しい選択です。その柔軟性こそがCLIの設計意図であり、セットアップのコストも一度払えばそれで済みます。

ターミナルを一切開かずに、正確ですぐに公開できる動画字幕が欲しいだけなら、コード不要の道のほうが速く目的地に着きます。中身の技術は同じでも、環境構築の手間はなく、そのうえ生のWhisperには最初から組み込まれていなかった字幕専用のツール群まで手に入るのです。

Subtitle Studio

Pythonも、Homebrewも、ターミナルも不要。動画をドラッグするだけです。


よくある質問

MacでWhisperを使うのにPythonの知識は必要ですか?

公式のopenai-whisperパッケージを使うのであれば、必要です。Pythonをインストールし、仮想環境を管理し、ターミナルからコマンドを実行する必要があります。コードに触れたくない場合は、Subtitle Studioのようなアプリが同系統のモデルをドラッグ&ドロップのインターフェースで提供しており、コーディングは一切不要です。

なぜMacでWhisperのインストールが失敗するのですか?

よくある原因は、サポート対象外のPythonバージョンを使っていること(現時点では3.13だとインストールが失敗するため3.10〜3.12を使う必要があります)、FFmpegをインストールしていてもシステムのPATHに含まれていないこと、そしてtiktoken依存パッケージをソースからビルドするのに必要なRustコンパイラが入っていないことです。それぞれ異なる、しかもかなり読み解きにくいエラーメッセージが出ます。

WhisperはMacのGPUを使いますか?

PyTorchのApple製MPS(Metal Performance Shaders)バックエンドを通じて使うことはできますが、Whisperの一部の演算に対するMPSサポートには記録されている抜け穴があります。一部の演算子は未実装で、気づかないうちに遅いCPU実行にフォールバックしてしまうのです。whisper.cppやmlx-whisperは一般に元のPythonパッケージよりもApple Siliconを効率よく使いますが、どちらもソースからのコンパイルが必要です。

openai-whisper、whisper.cpp、mlx-whisperの違いは何ですか?

openai-whisperはOpenAI純正のPythonパッケージで、pipで最も簡単にインストールできますが、PyTorchのMPSバックエンド経由で動くためApple Siliconでは速度が出にくい面があります。whisper.cppはMetalを直接使うC++の再実装版で、大幅に高速ですが、リポジトリをクローンして自分でコンパイルする必要があります。mlx-whisperはApple独自のMLXフレームワークを使い、M系チップ上ではしばしば最速の選択肢になりますが、こちらも似たようなソースからのセットアップが必要です。この3つはいずれも音声の前処理、字幕編集、翻訳機能を含んでいません——あくまで文字起こしエンジンであって、字幕ツールではないのです。

コードを書かずに無料でMacでWhisperを動かす方法はありますか?

Whisperモデル自体は無料でオープンソースですが、セットアップなしで動かすには、生のPythonライブラリではなくパッケージ化されたアプリが必要です。誰かがインストール、モデル管理、インターフェースをあなたの代わりに整えている必要があるということです。Subtitle Studioはまさにそのために作られたMacアプリで、ターミナルも依存パッケージの管理も不要、サブスクリプションではなく買い切りで利用できます。

Subtitle Studioはコマンドラインと同じWhisperモデルを使っていますか?

Subtitle Studioは、動画クリエイターが実際に扱うような複雑な音声——音楽に重なるセリフ、部屋の雑音、多言語の発話——のために最適化・ファインチューニングされたWhisperモデルを、Apple Siliconアクセラレーションと組み合わせて使用しています。それはpip install openai-whisperで手に入る単体のモデルではなく、前処理、幻覚フィルタリング、強制アライメント、NLPセグメンテーションまでを含む一連のパイプラインとして包まれています。このパイプラインが実際の出力にどう影響するかについては、MacWhisper vs Subtitle Studioの比較記事で詳しく見ることができます。

Subtitle Studioを無料でお試し

買い切り。月額不要。Macで完全オフライン動作。

Macでダウンロード — 無料