VoiceStudioとは?無料で使えるローカル音声クローンの始め方

目次

ElevenLabsのような音声クローンや動画の吹き替えを試したいけれど、自分の声やクライアントの素材をクラウドに預けるのは気が進まない。そんな人が候補に入れやすいのが、GitHubで公開されているオープンソースの「VoiceStudio」です。

この記事では、VoiceStudioでできること、動かすために必要なPC環境、使い始める手順、商用で使う前に確認しておきたいライセンスの注意点を、公式のREADMEをもとに整理します。結論は、自分のPCで音声制作を完結させたい人には試す価値があり、手軽さや日本語品質の保証を求める人には向かない、です。

※本記事は2026年10月6日時点のGitHubリポジトリの情報をもとにしています。機能や配布形態は更新されるため、最新情報は公式リポジトリをご確認ください。

結論:VoiceStudioは「自分のPCで完結する音声制作アプリ」

VoiceStudioは、音声クローン、ボイスデザイン、動画の吹き替え、ディクテーション、文字起こし、オーディオブック作成を1つのデスクトップアプリにまとめたオープンソースのソフトです。READMEは自らを「完全ローカルのElevenLabs代替」と位置づけています。処理は自分のハードウェア上で動き、外部サービスの利用は任意です。

向いているのは次のような人です。

  • 自分の声やクライアント素材を、外部サーバーに送らずに加工したい
  • 動画の吹き替えやナレーションを、複数言語で試作したい
  • 外部サービスのクレジットや従量課金を気にせず、繰り返し生成したい
  • ローカルAPIやMCP経由で、自分のスクリプトやAIエージェントから音声生成を呼び出したい

向いていないのは、次のような人です。

  • インストールやモデルのダウンロードを自分で管理したくない
  • すぐに商用の納品物として使える品質と権利関係の保証がほしい
  • 古いPCやIntel Macだけで、すべてを手元で動かしたい

とくに商用利用は、アプリ本体のライセンスとは別に、モデルごとのライセンスを確認する必要があります。詳しくは後半の章で説明します。

VoiceStudioでできること

READMEでは機能が「Create(作る)」「Produce(制作する)」「Connect(つなぐ)」の3つに分けられています。実際に触る機能は次の6つです。
機能できること
音声クローン声を選ぶか、きれいな参照音声を用意して、入力したテキストを読み上げさせる
ボイスデザイン参照音声なしで、声の特徴を言葉で描写して新しい声を作る
動画ダビング動画の音声を、タイミングを合わせた別言語の音声に置き換える
ディクテーション画面上に浮かぶウィジェットから、音声入力で文字を入れる
文字起こし音声や動画をテキストにする
ストーリー・オーディオブック・バッチ長い原稿の読み上げや、複数ジョブのまとめ処理をする

文字起こしを使う手軽さも見逃せません。動画の吹き替えは「文字起こし→翻訳→音声合成」という流れの作業なので、1つのアプリの中で通して進められます。複数のサービスを行き来する手間が減る点は、ローカルツールを選ぶ大きな理由になります。

エンジンはデフォルトの「VoiceStudio」(k2-fsa/OmniVoiceがベース)から別のものに切り替えられます。第三者の解説記事によると、音声合成16種類、音声認識11種類のエンジンが統合されています。ただし数は変わる可能性があるため、READMEの機能・エンジンカタログで最新の一覧を確認してください。

対応言語はREADMEで646言語とされています。これは言語カタログ全体の数字で、すべての言語で同じ品質が出るという意味ではありません。日本語の読み上げ品質については、本記事では検証していないため、導入前に自分の原稿で試すことをおすすめします。

ElevenLabsとの違い:クラウド課金型とローカル型

ElevenLabsは、ブラウザから使うクラウド型のサービスです。VoiceStudioは自分のPCにインストールして使うため、仕組みが根本から違います。

比較項目ElevenLabsVoiceStudio
実行場所クラウド自分のPC(ローカル)
料金体系公式サイト参照READMEに有料プランの記載なし(モデルのライセンスは別)
音声データの扱いサービスに送信して処理ローカル処理が基本。外部サービスは任意で、利用状況の分析は同意が必要
導入の手間アカウント登録のみアプリのインストールとモデルのダウンロードが必要
対応言語公式サイト参照646言語のカタログ(品質は言語とエンジンによる)
動作条件ブラウザがあれば使えるGPUがあると快適、なくてもCPUで動くが遅い
外部連携公式サイト参照ローカルAPIとMCPに対応

VoiceStudioを選ぶ利点は、データを手元に置けることと、生成回数を気にせず試せることです。代わりに、環境構築とモデルの権利確認という作業が自分に回ってきます。料金や機能は変わりやすいため、ElevenLabs側の最新条件は公式サイトで確認してください。

自分のPCで動くか:対応環境とスペック

READMEが示すハードウェアごとの対応は次のとおりです。

環境対応状況
NVIDIA GPU(Windows / Linux)CUDAで高速化
Apple SiliconMetal(MPS)で高速化
GPUなし(Intel/AMD内蔵グラフィックス、古いPCなど)CPUで動くが遅い。セットアップでCPU版PyTorchを入れ、空き容量は約5GB必要
Windows on ARM(Snapdragon Xなど)実験的。CPUのみ
Intel Macアプリの画面のみ。バックエンドはリモートに接続する

メモリやディスクについては、第三者の解説記事が「RAM 8GB以上(推奨16GB以上)」「空きディスク10GB以上」を目安として紹介しています。ただしREADMEでは、必要なスペックはエンジンごとに異なると書かれています。大きなモデルを使うときは、パフォーマンスのドキュメントを確認してください。

GPUがないPCでも試せるのは助かる点です。ただし生成に時間がかかるため、まず短いテキストで1本作ってみて、待てる速さかどうかを判断するのが現実的です。

インストールと最初の1本

インストール方法は、ワンコマンドでの導入と、リリースページからのダウンロードの2通りです。

ワンコマンドで入れる場合

macOS / Linuxはターミナルで次のコマンドを実行します。

curl -fsSL https://voicestudio.sh/install | sh

WindowsはPowerShellで次のコマンドを実行します。

irm https://voicestudio.sh/install | iex

どちらもネット上のスクリプトを直接実行する方式です。実行前にスクリプトの中身を確認するか、次のリリースページからのダウンロードを選ぶと安心です。

ダウンロードして入れる場合

GitHubのReleasesから、macOSは.dmg、Windowsは.exe、Linuxは.AppImageまたは.debを取得します。Dockerでの導入手順も公式のドキュメントにあります。

インストールしたら、最初の1本は次の流れで作ります。

  1. アプリで「Voice cloning(音声クローン)」を開く
  2. 用意されている声を選ぶか、きれいな参照音声を追加する
  3. 読み上げさせたいテキストを入力して生成する
  4. 求められたら、必要なモデルをインストールする

最初は、同梱されているデモ用の声で試すのが無難です。自分や他人の声を使うのは、動作を確認してからにしましょう。

注意点が1つあります。READMEによると、デスクトップアプリはElectron版のみです。バージョン0.5.3がTauri版の最後のリリースで、Tauri版を使っていた人はElectron版を別途インストールする必要があります。古い解説記事の画面や手順が、いまの配布形態と違う場合があります。

商用利用の前に確認すること

VoiceStudioを仕事で使う前に、確認したい点が3つあります。

1. アプリ本体はAGPL-3.0

アプリ本体はAGPL-3.0で公開されています。自分で使うぶんには問題になりにくいライセンスですが、VoiceStudioのコードを改変してサービスとして公開する場合は、ソースコードの公開義務が生じることがあります。組み込みやサービス提供を考えているなら、条文を確認するか、専門家に相談してください。

2. モデルは別のライセンス

READMEは、モデルごとに独自のライセンスがあり、商用利用の前に確認するよう求めています。第三者の解説記事には、デフォルトエンジンの重みが非商用ライセンスだという記載があります。本記事ではこの点を一次情報で確認できていません。仕事で使うなら、使うエンジンのライセンスを必ず自分で読んでください。

3. 声のクローンは許可を得た声だけ

READMEは「許可を得た場合のみ」声のクローンを使うよう明記しています。本人の同意がない声を使うことは、トラブルの原因になりえます。クライアントの声や社員の声を使うときは、利用目的を書面で残しておくと後で困りません。

VoiceStudioが向いている人・向いていない人

向いている人

  • 音声や動画の素材を、自分のPCの外に出したくない人
  • ElevenLabsのようなサービスと並行して、ローカルの選択肢を持っておきたい人
  • ターミナルやインストーラの操作に抵抗がなく、環境トラブルを自分で調べられる人
  • APIやMCPを使って、自作のツールに音声生成を組み込みたい人

向いていない人

  • 登録してすぐ使える手軽さを重視する人
  • 日本語の読み上げ品質を、導入前に確かめる時間が取れない人
  • ライセンスの確認を面倒に感じ、商用利用のリスクを取りたくない人
  • GPUのないPCで、大量の音声を短時間で作りたい人

まずは短いテキストで1本作り、待ち時間と音質に納得できてから本格的に使い始めるのが無理のない進め方です。

よくある質問(FAQ)

Q. VoiceStudioは無料で使えますか?

アプリ本体はオープンソースで、READMEに有料プランの記載はありません。ただし、モデルには独自のライセンスがあるうえ、将来の条件が変わる可能性もあります。最新の状況は公式リポジトリで確認してください。

Q. GPUがないPCでも動きますか?

READMEによると、GPUなしでもCPUで動きます。ただし生成は遅くなり、CPU版のセットアップに約5GBの空き容量が必要です。Intel Macはアプリの画面のみで、バックエンドは別の環境に接続します。

Q. 日本語で使えますか?

READMEには日本語版(README_JA)があり、対応言語は646言語のカタログに含まれます。ただし、日本語の読み上げ品質は本記事では検証していません。使うエンジンによって差が出る可能性があるため、自分の原稿で試して判断してください。

Q. 生成した音声を商用で使えますか?

アプリ本体のライセンスと、使うモデルのライセンスの両方を確認する必要があります。READMEは商用利用の前にモデルのライセンスを確認するよう求めています。声のクローンは、許可を得た声に限って使ってください。

まとめ

VoiceStudioは、音声クローンから動画の吹き替え、文字起こしまでを自分のPCで完結させられるオープンソースのアプリです。データを手元に置いたまま、繰り返し試せる点が強みです。

一方で、環境構築とモデルのライセンス確認は自分で行う必要があります。日本語の品質も未知数なので、まずは同梱のデモ用の声と短い原稿で試し、使えそうなら次の段階に進んでください。

参考にした情報