Whisperで歌詞字幕(SRT)を自動生成する方法|Groq・OpenAI・ブラウザ内の比較

公開日:

アルバム1枚分の歌詞にタイムスタンプを手で打つのは大変です。OpenAIの音声認識モデル「Whisper」を使えば、曲を聴かせるだけで数秒〜数分でタイミング付きの歌詞ができあがります。この記事では、LyricsFlow MVMakerでWhisperを使う3つの方法を比べ、歌声から正確な字幕を作るコツを紹介します。

Whisperは歌をどう認識するか

Whisperは主に話し声で学習されたモデルですが、ボーカルがはっきりしていて伴奏が厚すぎなければ、歌でもかなりの精度で認識します。出力は開始・終了時間付きの区間(セグメント)なので、そのままSRTのブロックになります。ただし、次のような苦手もあります。

出力は「下書き」と考えましょう。タイミングの骨組みはたいてい良好で、文字は歌詞カードと照らし合わせて校正する、という使い方がおすすめです。

3つの方法の比較

Groq Whisper APIOpenAI Whisper-1 APIブラウザ内Whisper
速さ最速(1曲数秒)速いPC性能しだい・遅め
費用無料枠あり従量課金無料
APIキー必要(自分で取得)必要(自分で取得)不要
モデルlarge-v3-turbo / large-v3whisper-1Tiny(約75MB)/ Base(約140MB)
精度高い高いやや低い(ボーカルが明瞭な曲向け)
音声の送信先ブラウザからGroqへブラウザからOpenAIへ端末の外に出ない

多くの場合は、Groq APIの whisper-large-v3-turbo がバランス最良です。言葉の取りこぼしが多いときは whisper-large-v3 を試してください。未発表曲をどこにも送りたくない場合や、APIキーがない場合はブラウザ内Whisperを使いましょう。

LyricsFlow MVMakerでの手順

  1. エディタを開き、音源ファイルを読み込みます。
  2. SRT自動生成パネルを開きます。
  3. APIの種類を選びます。Groqの場合は console.groq.com/keys でキーを作成して貼り付けます。キーはお使いのブラウザにのみ保存されます。
  4. ブラウザ内モデルを使う場合は、文字起こしの言語を指定します。言語を明示すると、イントロで言語を誤判定するのを防げます。
  5. 生成を開始します。完了すると、処理時間・フレーズ数・SRTのプレビューが表示されます。
  6. タイムラインに適用 するか、いったん SRT保存 して別のツールで編集します。

精度を上げるコツ

プライバシーについて

APIを使う場合、音源はブラウザから選択した事業者へ直接送信され、LyricsFlow MVMakerのサーバーは経由しません。未発表曲の場合は、各事業者のデータの取り扱いを確認してください。ブラウザ内Whisperなら、音源がPCの外に出ることはありません。詳しくは プライバシーポリシー をご覧ください。

次のステップ

歌詞がタイムラインに並んだら、🎲 全フレーズにランダム適用 で下書きを作り、大事な行を仕上げていきましょう。やり方は 文字アニメーションのコツ8選 で解説しています。

さっそくリリックビデオを作ってみませんか? ブラウザだけで動作し、無料・登録不要です。

⚡ エディタを開く