反響が混ざった講義音声を聞きやすくする
AI
ツール
(Adobe Podcast Enhance Spee
ch)

録音した講義音声が反響でひどく聞き取りにくい、という状況はよくあります。
マイクから遠い、天井が高い、壁が硬い。
条件が悪いと声と反響が完全に混ざり合い、ただの音量調整では太刀打ちできません。

この記事では、そういった音声を聞きやすくするためのアプローチを整理します。

関連記事

1. Audacity で試す反響低減の手順

Audacity にはリバーブ専用の除去機能がありませんが、ただ、複数の処理を順に重ねることで声を前に出せます。

  1. 無音区間(話者がいない数秒)を選択し、「エフェクト→ノイズ除去→ノイズプロファイルを取得」する。
    続いて全体を選択してノイズ除去を適用する。
    Noise reduction(低減量)は6〜12dBを目安にし、強くしすぎると声が不自然になる。
  2. 「エフェクト→Filter Curve EQ」で100Hz以下の低音域をカットする。
    反響のこもりは低〜中低音に集中しやすく、ここを削ると声が明瞭になる。
  3. 「エフェクト→Compressor」をかける。
    Threshold(しきい値)は−18〜−12dB、Ratio(圧縮比)は3:1〜4:1程度が目安。
    音量差を圧縮することで、反響に埋もれていた直接音が相対的に前に出る。
  4. 「エフェクト→Normalize」で最終的な音量を整える。

処理はこの順番通りに行うのが基本で、ノイズ除去を先にしてからEQをかけないとプロファイルが一致しなくなります。
反響が声本体に深く混ざった音声では改善に限界があり、このワークフローはあくまでも補助的な処理です。

1.1. 反響をどう捉えるか

「反響がひどい」と感じる音声には、大きく2種類の問題が混在しています。

  • ひとつは reverb(リバーブ:残響)です。
    声が壁や天井に当たって返ってくる成分で、音全体に「尾を引く」印象を与えます。
  • もうひとつは echo(エコー)で、声が遅延して繰り返して聞こえる現象です。
    講義録音ではリバーブのほうが問題になりやすいです1

重要なのは、これらが録音時点で声の波形と混ざってしまっている点です。

EQ(イコライザー:周波数ごとの音量調整)やコンプレッサーで声を「整える」ことはできても、混ざり込んだ残響成分だけを取り除くのは通常の音声編集の範囲を超えます。
そのため dereverb(ディリバーブ:残響成分の低減)に特化したAI処理が有効になります2

2. Adobe Podcast Enhance Speech

無料枠は1ファイル30分・1日1時間の制限があります3

90分の音声を30分ずつに分割して2日かけて処理すれば、無料のまま完結できます。
処理後の品質は安定しており、まず最初に試す価値があります。

3. そのほかのツール比較

日本語対応があり、現実的に使えるものを絞って比較します。

サービス90分の最低費用主な制約
Adobe Podcast0円分割・複数日処理が必要
Auphonic0円無料版はジングル挿入
Waves Voice ReGen約800円/月1ファイル60分まで
ElevenLabs約1,730円1ファイル60分まで
iZotope RX16,900円〜(買い切り)繰り返し使うほど割安

3.1. Auphonic

月2時間まで無料で使えます4
Noise & Reverb Reduction(ノイズ・残響低減)、音量均一化、AutoEQ(自動音質補正)がセットになっており、操作もシンプルです。
ただし無料ユーザーの出力ファイルにはジングルが挿入されます5

3.2. Waves Voice ReGen

月額約800円($4.99)のCreatorプランで300分/月まで処理できます6

3.3. ElevenLabs Voice Isolator

使った分だけ課金する従量制で、1分あたり$0.12です7

3.4. iZotope RX

サービスではなく買い切りのソフトウェアです。

Elementsが約16,900円、Standardが約67,800円。
Dialogue Isolate(会話音声分離)や Dialogue De-reverb(会話向け残響低減)を含む本格的な処理が可能で、映像・音声ポストプロダクションの現場でも使われているツールです8

4. OBS + 仮想ケーブル + Zoom という選択肢

まったく別のアプローチとして、OBS Studio で音声ファイルを再生し、Zoom のノイズ除去を通して録画し直す、というワークフローがあります9

Zoomに音声を渡すには、OBSの再生音をそのままZoomのマイク入力に接続する仕組みが必要です。
これを実現するのが virtual audio cable(仮想オーディオケーブル:アプリ間で音声を受け渡す仮想デバイス)で、Windowsなら VB-Cable、macOSなら BlackHole が代表的です10

手順の流れは次の通りです。

  1. VB-Cable(または BlackHole)をインストールする
  2. OBSの「設定→音声→モニタリングデバイス」を仮想ケーブルに設定する
  3. OBSの音声ミキサーの詳細音声プロパティで、音声ファイルを「モニターと出力」にする
  4. Zoomのマイク入力を仮想ケーブルに切り替える
  5. Zoomの音声設定で Noise removal(ノイズ除去)を有効にし、Background noise suppression(背景ノイズ抑制)を High にする
  6. Zoomで録画する
  7. ローカル録画のM4Aファイルを取り出す11

Zoomは1対1またはグループ通話であれば、無料プランでも40分制限は適用されません。自分一人でセッションを開けばそのまま使えます12

ただし、Zoomのノイズ除去はリアルタイムの会議向けにチューニングされた処理です。
反響が声に深く混ざり込んだ音声では改善幅が限られることがあります13
「無料でひとまず試す」ための実験的なアプローチと考えておくのが妥当です。

5. どれを選ぶか

最初の1本を試すなら、まず Auphonic と Adobe Podcast Enhance Speech を同じ音声にかけて比較するのが低コストで速いです。
それでも反響が残る場合は、ElevenLabs Voice Isolator か iZotope RX に進む流れになります。

文字起こしが目的なら処理は強めでも問題ありません。
公開・保存が目的なら、強すぎる処理が声質を変えることがあるので、自然めの設定から試すのがよいです。

  1. 教室や会議室は吸音処理のない硬い壁面に囲まれることが多く、音の反射が重なりやすい。音が60dB減衰するまでの時間を示す RT60(残響時間)は、吸音処理のない講義室では1〜2秒程度になることもある。エコーと混同されやすいが、リバーブは反射音が連続的に重なって「響き」として知覚される点でエコーとは異なる。
  2. AI dereverbはニューラルネットワークを使い、混在した残響成分と直接音を推定・分離する手法が主流。従来のEQやノイズリダクションでは残響そのものを除去できないが、深層学習系のモデルは音声の統計的パターンを学習して残響を推定できる。 – RX De-reverb | iZotope
  3. Premiumプランでは1ファイル最大2時間、1日4時間まで拡張される。30日間の無料トライアルも提供されており、プランの比較は公式サイトで確認できる。 – Adobe Podcast plans
  4. 無料クレジットは毎月リセットされ、未使用分は翌月に繰り越されない。サインアップにクレジットカードは不要。 – Auphonic Pricing
  5. ジングルはファイルの先頭と末尾の両方に追加される。文字起こし用途などで不要な場合は、Audacityで先頭と末尾を切り取ることができる。 – Auphonic
  6. 価格は変動する場合があり、最新の料金は公式サイトで確認を。記事執筆時点での換算レートは1USD≒160円。 – Waves Voice ReGen
  7. サブスクリプションプランを選択すると単価が変わる場合がある。最新の料金体系はAPIプライシングページで確認を。 – ElevenLabs API Pricing
  8. 映画・TV・ポッドキャストの音声ポストプロダクションで標準的に使われるツールのひとつ。RX 12ではDialogue Isolateのニューラルネットが更新されており、前バージョンよりも声と背景音の分離精度が向上している。 – iZotope RX 12
  9. OBS公式もZoomなどのビデオ通話アプリへの音声ルーティング手順を案内している。 – Video Call Streaming Tutorial | OBS Studio
  10. VB-Cableは個人利用が無料(寄付ウェア)。macOS向けのBlackHoleはExistentialAudioによるオープンソースプロジェクトで、2chと16chのバリアントがある。Homebrewで brew install blackhole-2ch からもインストール可能。 – VB-Audio Virtual Cable / BlackHole GitHub
  11. Zoomのローカル録画はデフォルトでMP4(動画)、M4A(音声)、チャットテキストを保存する。音声ファイルだけ使いたい場合はM4Aを直接利用できる。 – Getting started with computer and cloud recording | Zoom
  12. 2022年7月15日以降、ZoomのBasicプランでは1対1ミーティングにも40分制限が適用されるようになった。本ワークフローのように参加者が自分のみのセッション(他に誰も参加しない状態)での動作については Zoom公式は明示していないため、事前にテストして確認することをすすめる。ローカル録画自体は無料プランでも利用できる。 – Zoom now limits free one-on-one meetings to 40 minutes | TechRepublic
  13. ZoomのNoise removalはファン音や周囲の話し声のような定常的なノイズを抑える設計であり、声と混ざった残響成分の除去には向いていない。Zoom公式のサポートページでも、会議中のマイク入力のノイズ抑制とエコーキャンセルが主目的として説明されている。 – Setting up professional audio for Zoom Meetings | Zoom