自分の声をAI音声に!Style-Bert-VITS2+AivisSpeechで音声生成してみた

AI

Style-Bert-VITS2

Style-Bert-VITS2/インストール

まずはStyle-Bert-VITS2のサイトからzipファイル(sbv2.zip)をダウンロードする。ダウンロードしたsbv2.zipを解凍し、インストールしたいフォルダに移動する。私の場合、「C:\Style-Bert-VITS2」に移動した。

Install-Style-Bert-VITS2.batを実行する。
 ★GPUあり:Install-Style-Bert-VITS2.bat
  GPUなし:Install-Style-Bert-VITS2-CPU.bat

コマンドプロンプトが表示されインストールが行われる。この時、私の環境では以下のエラーが発生した。

--------------------------------------------------
Installing other dependencies...
--------------------------------------------------
Executing: uv pip install -r requirements.txt
Using Python 3.10.11 environment at: venv
  x Failed to build `av==10.0.0`
  |-> The build backend returned an error
  `-> Call to `setuptools.build_meta:__legacy__.build_wheel` failed (exit code: 1)

hint: `av` (v10.0.0) was included because `faster-whisper` (v0.10.1) depends on `av>=10.dev0, <11.dev0`
hint: Build failures usually indicate a problem with the package or the build environment
Press any key to continue . . .

faster-whisperav==10.0.0 を要求し、その av==10.0.0 のCythonビルドが失敗しているらしい。

解凍したフォルダに「Style-Bert-VITS2\requirements.txt」があるのでテキストエディタで開き、faster-whisperの行をコメントアウトする。faster-whisperは音声→文字起こしで必要になるようで、私には不要なので問題なし。

accelerate
cmudict
cn2an
# faster-whisper==0.10.1
・・・

コメントアウトが完了したら、コマンドプロンプトで解凍したフォルダ「Style-Bert-VITS2」に移動する。そして、コマンドを実行。

cd C:\Style-Bert-VITS2\Style-Bert-VITS2
venv\Scripts\python.exe -m pip install -r requirements.txt

最新の情報はgithubのStyle-Bert-VITS2の公式サイトを参考にしてほしい。

GitHub – litagin02/Style-Bert-VITS2: Style-Bert-VITS2: Bert-VITS2 with more controllable voice styles.
Style-Bert-VITS2: Bert-VITS2 with more controllable voice styles. – litagin02/Style-Bert-VITS2

Style-Bert-VITS2/起動

初期化

以下のコマンドでinitialize.pyを実行し、各種モデルをダウンロードする。これにはかなりの時間がかかる。

cd C:\Style-Bert-VITS2\Style-Bert-VITS2
venv\Scripts\python.exe initialize.py

データセット作成

App.batを実行すると、私の環境では以下のエラーが発生。

Running app.py...
[transformers] Disabling PyTorch because PyTorch >= 2.5 is required but found 2.3.1+cu118
[transformers] PyTorch was not found. Models won't be available and only tokenizers, configuration and file/data utilities can be used.
Traceback (most recent call last):
  File "C:\Style-Bert-VITS2\Style-Bert-VITS2\app.py", line 10, in <module>
    from gradio_tabs.inference import create_inference_app
  File "C:\Style-Bert-VITS2\Style-Bert-VITS2\gradio_tabs\inference.py", line 32, in <module>
    pyopenjtalk.initialize_worker()
  File "C:\Style-Bert-VITS2\Style-Bert-VITS2\style_bert_vits2\nlp\japanese\pyopenjtalk_worker\__init__.py", line 128, in initialize_worker
    raise TimeoutError("サーバーに接続できませんでした")
TimeoutError: サーバーに接続できませんでした
Press any key to continue . . .

Style-Bert-VITS2の依存関係が2026年現在の最新版ライブラリと噛み合っていないようなので以下を実行。

cd C:\Style-Bert-VITS2\Style-Bert-VITS2
venv\Scripts\python.exe -m pip install --force-reinstall "transformers==4.39.3"

それでもまだエラーが出るので以下を実行。

venv\Scripts\python.exe -m pip install --force-reinstall ^
  "transformers==4.39.3" ^
  "huggingface-hub==0.24.6" ^
  "gradio==4.43.0" ^
  "gradio-client==1.3.0" ^
  "numpy==1.26.4"

venv\Scripts\python.exe -m pip uninstall hf-gradio

以下のコマンドで依存関係を確認する。

venv\Scripts\python.exe -m pip check
No broken requirements found.

以下のコマンドでバージョンを確認する。

venv\Scripts\python.exe -c "import torch, transformers, gradio, huggingface_hub, numpy; print('torch:',torch.__version__); print('transformers:',transformers.__version__); print('gradio:',gradio.__version__); print('huggingface-hub:',huggingface_hub.__version__); print('numpy:',numpy.__version__)"

torch: 2.3.1+cu118
transformers: 4.39.3
gradio: 4.43.0
huggingface-hub: 0.24.6
numpy: 1.26.4

App.batを起動

TimeoutError: サーバーに接続できませんでした
Press any key to continue . . .

まだエラーが出るので追加で対応。

venv\Scripts\python.exe -m pip install --force-reinstall "setuptools==80.9.0"
venv\Scripts\python.exe -m pip install --force-reinstall "pydantic==2.9.1"

App.batを起動し、ブラウザに「http://127.0.0.1:7860/」が表示されれば成功。

ここまでのセットアップで14.8GBほどの記憶容量を必要とした。

現時点での最終的なrequirements.txtは以下となる。これは環境構築時のリリースバージョンの状況により変動することを認識していただきたい。

accelerate
cmudict
cn2an

# PyAV 10.0.0 が現在の環境でビルドできないため使用しない
# faster-whisper==0.10.1

g2p_en
GPUtil

# 最新Gradioとの互換性問題を避ける
gradio==4.43.0
gradio-client==1.3.0

jieba
librosa==0.9.2
loguru
nltk<=3.8.1
num2words

# Style-Bert-VITS2自体もnumpy<2を要求
numpy==1.26.4

onnx
onnxconverter-common
onnxruntime
onnxruntime-directml; sys_platform == 'win32'
onnxruntime-gpu; sys_platform != 'darwin'
onnxsim-prebuilt

protobuf==4.25

psutil
punctuators
pyannote.audio>=3.1.0
pyloudnorm
pyopenjtalk-dict
pypinyin
pyworld-prebuilt
stable_ts
tensorboard

# PyTorchは別途CUDA 11.8版をインストールする
torch<2.4
torchaudio<2.4

# 今回正常起動を確認できた組み合わせ
transformers==4.39.3
huggingface-hub==0.24.6

# Gradio 4.43との互換性確保
pydantic==2.9.1

# pyopenjtalkのpkg_resources対応
setuptools==80.9.0

umap-learn

Style-Bert-VITS2/音声データの登録

自分の声を録音したデータを準備し、「C:¥Style-Bert-VITS2\Style-Bert-VITS2\inputs」に音声データを配置する。このフォルダはインストールした段階で存在していたものだ。音声データのファイル名は「my-voice.mp3」とした。

音声スライス

スライスを実行するとすぐに処理が完了し、「C:¥Style-Bert-VITS2\Style-Bert-VITS2\Data\my-voice\raw」配下に複数のファイルが作成される。

文字起こし

スライスした音声データを使用し文字起こしを行う。

「HuggingFaceのWhisperを使う(速度が速いがVRAMを多く使う)」にチェックを入れ、「音声の文字起こし」を実行する。結果エリアに「音声の文字起こしが完了しました。」が表示されると成功である。

文字起こし結果は「C:¥Style-Bert-VITS2\Style-Bert-VITS2\Data\esd.list」に出力され、テキストエディタで開くことができる。中身を確認し、誤認識されている箇所を手修正する。

学習前準備

自動前処理という機能があるので実行する。

自動前処理を行うと「C:¥Style-Bert-VITS2\Style-Bert-VITS2\Data\my-voice」配下に様々なファイルが作成される。学習設定や音声ファイルの変換などが行われる。

学習

メモリ:32GB、GPU:6GBのPCで学習に掛かった時間は、
 スライス後の音声データ数「25」の場合、5時間
 スライス後の音声データ数「200」の場合、12時間
となった。

学習が完了すると「C:¥Style-Bert-VITS2\Style-Bert-VITS2\model_assets\my-voice」配下にファイルが出力される。

Style-Bert-VITS2/音声合成

音声合成/App.batで。

App.batで起動したGUIで「音声合成」タブを選択する。

先ほど学習させたモデルを選択し、音声合成を行うと数秒で再生できるようになる。

音声合成/Editor.batで。

Editor.batを起動して音声合成を行う方法もある。こちらのほうが強弱を設定できるので学習結果を把握しやすい。

Style-Bert-VITS2/AivisSpeech用の .aivmx を作成する

「ONNX変換」タブから対象モデルを選択し変換を実行する。

AIVM Generator

aivmxの生成

AIVM Generator | AI音声合成モデルファイル生成・編集ツール
このサイトでは、AivisSpeech などで使える AI 音声合成モデルファイル (AIVM / AIVMX) を、簡単に作成・編集できます。

上記のWEBサイトを開き、さきほど作成したファイルを指定する。

AivisSpeech

AivisSpeechのセットアップは非常に簡単である。

ダウンロード&インストール

Aivis Project | AivisSpeech でかんたんに感情豊かな音声合成、使ってみませんか?
Aivis Project は、感情豊かな音声合成技術を誰もがかんたんに活用できる未来を目指す、壮大な開発プロジェクトです。AivisSpeech を使えば、物語の朗読やニュース記事の読み上げなど、あなたの想いを魅力的な声で表現できます。音…

起動

これがAivisSpeechを起動した直後の画面である。

.aivmxの登録

使用モデルが変更されたことを確認できる。

あとは自分の声で思う存分、音声を生成して楽しもう。

札幌在住エンジニア。JavaやPHPやWordPressを中心とした記事が中心です。

【SE歴】四半世紀以上
【Backend】php / java(spring) / c# / AdobeFlex / c++ / VB / cobol
【Frontend】 vue.js / jquery他 / javascript / html / css
【DB】oracle / mysql / mariadb / sqlite
【infrastructure】aws / oracle / gcp
【license】aws(saa-c03) / oracle master / XML Master / Sun Certified Programmer for the Java 2 Platform 1.4

Nobelをフォローする
AI
シェアする
Nobelをフォローする

コメント

タイトルとURLをコピーしました