音声学習からオリジナル合成音声モデル構築まで完全解説!
今回はローカル環境で動かせる合成音声モデルを無料で作って使えるまでを分かりやすく誰でも出来るよう解説していこうと思います。
①ボイス素材の収録
②Style-Bert-VITS2で音声学習
③AivisSpeech用で使えるようにモデル変換
…といった流れになります。
※全て無料で使うことができます
過去にもStyle-Bert-VITS2やAivisSpeechの内容を個別で書いていますが、今回は詳細な説明や応用は省いて、合成音声モデル構築までをこの記事1つでシンプルにまとめてみました。
※本記事の最終更新:2025/11/9
使用するツールとPC環境
PC環境(Windows / NVidiaのGPUが必要)
今回実施したPCスペック(参考):Windows11 / Core i7 / RAM32GB / GPU NVDIA GeForce RTX 4060 Laptop GPU 8BG
音声学習に必要なボイス素材の収録
まずは音声学習に必要なボイス素材を用意しましょう!
この素材の質と量が合成音声モデルを作るうえで重要な要素となってきます(ここに正解はないので参考程度に)。
素材の目安やポイントとしては、
30分程度~(これより少なくても学習自体は可能。3分程度の素材でも一応できたことありますがある程度の長さ推奨)
wavまたはmp3ファイル形式
台本はITAコーパスの文章リスト公開用リポジトリなどを読み上げて収録
※何でもOK(上記はあくまで一例)
素材ファイルは分割しても、まとめてもOK(ファイル内に沈黙があっても問題なし)
ノイズや雑音が入らないようにする
台本の他に独自のフレーズ(笑い方や言い回し、よく使う感情表現など)を含めると再現度が高まるかも?
上記を意識して音声学習に使用する.wavファイル(音声素材)が用意できたら次に進みます。

Style-Bert-VITS2インストール
では先ほど用意したボイス素材をもとに音声学習を回していきましょう!
Style-Bert-VITS2というツールを使用して行います。
https://github.com/litagin02/Style-Bert-VITS2/releases/download/2.6.0/sbv2.zip
まず、上記リンクからStyle-Bert-VITS2をダウンロードします。
そうすると「sbv2.zip」という圧縮フォルダがダウンロードされると思うので、zipを展開しましょう。
そして、今回は分かりやすくCドライブ直下に展開したsbv2フォルダの中にあるsbv2フォルダを配置したいと思います。

配置したら中身のInstall-Style-Bert-VITS2.batをダブルクリックしてインストールを開始します。



インストール完了したらエディターとターミナルは閉じてOKなので、次の音声学習のフェーズに移ります。
Style-Bert-VITS2で音声学習
※注意:他人の声を無許可で学習して公開したりなど、権利的に問題がある使い方はしないようにしてください。
sbv2 > Style-Bert-VITS2 > inputsフォルダ内に最初に収録したボイス素材ファイルを置きます。

素材を置いたら、sbv2 > Style-Bert-VITS2フォルダ内のApp.batをダブルクリックします。


ダブルクリックしてしばらくすると、上記のような画面がブラウザにて自動で開きます。

そしたら、タブの「データセット作成」を押下して、モデル名を入力しましょう。
今回はシロハナちゃんの音声モデルを構築するとして「shirohana」というモデル名にしました。(※シロハナちゃんの音声素材は正式に声優さんに依頼をし、合成音声モデルとして利用する旨の許諾を頂いております)

モデル名を入力したら下にスクロールして、「スライスを実行」を押下します。
しばらく待つと「音声のスライスが完了しました」と出ます。

スライスが完了したら、下にスクロールして「音声の文字起こし」を押下します。
こちらも同じくしばらく待つと「音声の文字起こしが完了しました。」と出ます。

音声の文字起こしが完了したら、「学習」タブに切り替えて、先ほど入力したモデル名と同じものを再度入力します。

モデル名を入力したら下にスクロールして、「自動前処理を実行」を押下します。
こちらも少し待つと、「Success: 全ての前処理が完了しました。」と出て完了します。

自動前処理が完了したら下にスクロールして、最後に「学習を開始する」を押下して音声学習を開始します。

音声学習の進捗はターミナルにて確認できますが、結構時間かかります。
最後までやろうとすると8hとか余裕で超えたりも…(素材量に依存)
ただ、最後まで行う必要はなく、ターミナルを閉じれば途中で切り上げることができます。※閉じるとその時点で学習が中断されるので注意。
学習が完了したら、sbv2 > Style-Bert-VITS2 > model_assetsフォルダ内にモデル名として入力した名前でフォルダがあるはずです。
これで該当フォルダ内に.safetensorsファイルが生成されていたら音声モデルの作成は完了となります!
AivisSpeechモデルに変換
次にAivisSpeechで使えるようにモデルを変換していきましょう。
まだAivisSpeechをインストールしてない場合は下記リンクからインストールしておきます。
前準備として先ほど音声学習時にも使用したStyle-Bert-VITS2のGradio上(App.bat起動)で変換に必要な.onnxファイルを作成していきましょう。

そこで先ほど作成したモデル名を一覧から選択して「ONNX形式に変換」ボタンを押すだけでOKです。
少し時間かかりますが完了するまで待ちます。
ONNX変換が完了したらAIVM Generatorで合成音声モデルをAIVM / AIVMX形式に変換してダウンロードしていきましょう。
※ファイル選択はmodel_assets階層の該当フォルダ内から選択
※合成音声名や制作者情報、アイコンなどを入力


これでAivisSpeechにAIVMXファイルを選択してインストール!


これでインストール完了です!
学習させたボイスの合成音声モデルをAivisSpeechにて簡単に使えるようになりました。

まとめ・活用アイデア
今回はボイス素材をもとに、音声学習から合成音声モデル構築までをシンプルに分かりやすくまとめてみました。
詳細やAPI活用、その他機能などは今回割愛しているので、興味がある方は下記も併せてご覧ください。
また、活用アイデアとして自身の合成音声モデルを作ることで、配信者などは自身のクローンAIを誕生させて企画にすることもできます。
【本物より賢い!?】クローンAI「朱音いまり」が あらわれた!
【 新時代の幕開け 】えぇ⁉本人不在でもコンビでコラボ配信ができちゃうんですか⁉🤔
このような形でAIキャラまたはクローンAIと配信で音声会話ができるシステムをBOOTHにて販売しているので興味ある方はご覧ください。
以上、それでは👋
