動画はできたのに、最後のナレーションで手が止まる。自分の声を録るには静かな場所が必要だし、文章を読み上げてもらうと、今度は抑揚が気になる。そんな小さな困りごとに、ちょうど新しい選択肢が出てきました。
2026年9月28日に発表されたElevenLabsの「Eleven v4」です。文章から音声を作るAIの新モデルで、読み方の指示を原稿に入れられる点が見どころ。同時に、会話の応答を速くする「Eleven v4 Turbo」も登場しました。
この記事では、日本語の短い動画や紹介音声を作りたい方に向けて、2モデルの違い、料金、原稿の整え方を見ていきます。いきなり難しい設定を覚える必要はありません。まずは、自分が伝えたい一文を、気持ちよく聴ける一文にするところから始めましょう。
情報確認:
Eleven v4とは?文章を「どう読むか」まで考える音声AI
ElevenLabsは、文章を入力して声にするText to Speech、つまり音声合成のサービスを提供しています。その声を作る仕組みの新しい世代がEleven v4です。サービス全体の名前とモデルの名前は、ここで分けて覚えておくと迷いません。
公式はv4について、文章の流れ、話し手、感情、話すテンポを踏まえた表現を重視するモデルだと紹介しています。たとえば、同じ「ありがとうございます」でも、お店の案内と友人へのひと言では、欲しい声の雰囲気が違いますよね。その違いを原稿側から伝えようとする仕組みです。
対応言語は日本語を含む90以上。日本語の原稿を使うことができます。ただし、対応していることと、どんな文章も一度で理想どおりに読めることは別です。人名や商品名、数字の読み方は、完成した音声で確かめる必要があります。
出典:Eleven v4・v4 Turboの公式製品紹介 / 公式のモデル・対応言語一覧

ここで期待したいのは、声を立派に飾ることより、伝えたい内容に合う話し方を探しやすくなることです。落ち着いた説明を元気いっぱいに読まれても、肝心な情報が頭に入りにくい。逆に、休日の小さな発見を紹介する動画なら、少し明るい声が似合うかもしれません。
私なら、最初に試すのは長い台本ではなく、いつも書いている紹介文の冒頭です。声にしたとき、自分の文章がどう聞こえるのか。その一回の確認だけでも、読む文章と聴く文章の違いが見えてくると思います。
なぜ今話題?Xの反響とランキングを見てみる
ElevenLabsの公式Xは、9月28日にv4とv4 Turboの紹介投稿を公開しました。9月29日に確認した時点で、その投稿の再生表示は約293万回。発表翌日の音声AIとして、大きな注目を集めていることがうかがえます。

ただ、Xの再生数は利用者数でも、導入した企業数でもありません。世界で最も需要があるAIを、この数字だけで決めることもできません。この記事では、新しい発表と大きな反響が重なったテーマとしてv4を取り上げています。
もう一つの材料が、独立した評価サイトArtificial Analysisの「Provider Voice Arena」です。9月29日に確認した同ランキングでは、Eleven v4が1位、スコアは1315でした。これは各社が用意した声を聴き比べ、どちらを好むかという投票を基にした評価です。
このランキングが扱うアクセントは米国・英国の英語です。日本語の人名が正しく読めるか、あなたの動画に合うかを直接証明するものではありません。「注目して試す理由」にはなりますが、「自分の原稿を聴かずに選ぶ理由」にはしないほうがよさそうです。
出典:Artificial Analysis:Provider Voice Arena

私が今回の発表で気になるのは、順位そのものより、原稿の書き方と声の表現が近づいてきたことです。文字を入れて終わりではなく、「ここはやさしく」「この一文は落ち着いて」と考えられる。文章を書く人にも、音声の仕上がりを選ぶ余地が増える点に面白さを感じます。
Eleven v4とv4 Turboの違い。動画ならまずv4から
名前が似ている2モデルですが、選び方はシンプルです。完成した音声を動画などに使うなら、まずEleven v4。相手の返答に合わせてすぐ話す仕組みを作るなら、v4 Turboを検討します。これは公式の用途説明を、日常の使い方に置き換えた目安です。
| 項目 | Eleven v4 | Eleven v4 Turbo |
|---|---|---|
| 公式の主な用途 | コンテンツ制作・ナレーション | リアルタイム会話・応答 |
| 今回の読者向けの目安 | 録画動画に入れる声の最初の候補 | 素早い対話の仕組みを作る場合の候補 |
| 日本語と音声タグ | 対応 | 対応 |
| 速さの数値の扱い | Turboの約100msを当てはめない | 公式の推論中央値約100ms。通信遅延を除く |
| 生成前に見ること | 声と原稿の相性 | 必要な利用環境・課金条件 |
スマホでは横にスクロールしてご覧ください。
出典:Eleven v4専用ガイド / Eleven v4の公式発表(2026年9月28日)
「Turbo」の文字を見ると、何でも速いほうを選びたくなるかもしれません。でも、録画した動画に声を付ける場合、会話の途中で相手を待たせない性能より、聞き取りやすい仕上がりを選べることのほうが大事です。まずv4で原稿と声の相性を見る、という進め方が自然だと思います。
v4 Turboの公式発表には、推論時間の中央値が約100ミリ秒、最初の音声が出るまでの中央値が約150ミリ秒とあります。いずれもネットワークの遅れを除いた、公式の測定条件による数値です。あなたのパソコンでボタンを押してから、長い音声がすべて完成するまでの時間ではありません。
この記事では、会話システムを組むためのコードは扱いません。短い日本語ナレーションを作るだけなら、最初からAPIやプログラミングの準備をする必要はないからです。まずWeb画面で声を作り、自分の用途に合うかを確かめるところに集中しましょう。
「v4を選んだのに思った声と違う」というときは、すぐ別モデルへ移るより、声の種類と原稿を見直してみてください。明るい案内に向いた声、静かな説明に向いた声では、同じ文章の印象も変わります。モデル名だけで、作品の雰囲気まで決まるわけではありません。
料金は無料から。Creatorの「11ドル」は初月の表示
9月29日に確認した公式の月払い表示は、Freeが0ドル、Starterが6ドル、Creatorが通常22ドル、Proが99ドルです。Creatorは初月50%割引で11ドルと表示されています。毎月ずっと11ドルという意味ではありません。
| プラン | 月額の通常表示 | 月間クレジット | 代表的な条件 |
|---|---|---|---|
| Free | 0ドル | 10,000 | 個人での試用。商用ライセンスなし |
| Starter | 6ドル | 30,000 | 商用ライセンス・Instant Voice Cloning |
| Creator | 22ドル(初月11ドルの割引表示) | 121,000 | Starterの内容に加えProfessional Voice Cloningなど |
| Pro | 99ドル | 600,000 | Creatorの内容に加え高い生成枠など |
スマホでは横にスクロールしてご覧ください。

表はWebの月払い表示です。税は別で、日本円の請求額は為替や決済条件によって変わります。年払いの月換算額とも区別して、契約する直前の画面を確認してください。
最初の候補としては、個人的に試すならFree、仕事に使う音声を作るなら商用ライセンスを含むStarter以上、という考え方が分かりやすいでしょう。自分の声を本格的に作り込むProfessional Voice Cloningを使いたい場合は、Creator以上の条件を見ます。
なお、無料版は商用利用のためのプランではありません。会社の商品紹介や広告に使う音声を、まず無料で完成させてから有料へ変更すればよい、と考えるのは避けましょう。利用条件は後のセクションで、もう少し具体的に整理します。
料金表のクレジット数は、作れる「完成動画の本数」ではありません。候補を作り直せば、その分の生成も考える必要があります。「短い原稿だから安い」とだけ判断せず、一つの原稿で何回くらい試したいかを先に決めておくと、プランを選びやすくなります。
私は、新しいAIを試すときほど、小さく始めるのがよいと思っています。一番高いプランで全部触るより、自分が毎週使う一本の動画で困りごとが減るかを見る。必要な機能が分かってから契約を考えたほうが、料金表もずっと読みやすくなります。
アプリの特典とAPIの割引は、それぞれ別に見る
発表直後なので、通常料金に加えて期間限定の案内もあります。少しややこしいのは、Web・モバイルアプリ向けと、API向けで内容が違うことです。自分がどこで生成するかを先に決めて読みましょう。
公式料金ページには、Creator以上を対象に、2週間、v4のText to Speechを月間枠の最大2倍まで通常の残高に計上せず試せる特典が掲載されています。対象はWeb・モバイルアプリです。FreeやStarterも含めた無制限の特典という案内ではありません。
一方、API料金ページは、v4が1,000文字あたり0.022ドル、v4 Turboが0.011ドルという割引価格を表示しています。期限表示は10月12日まで。併記された通常単価は、それぞれ0.08ドルと0.04ドルです。いずれも確認時点の表示で、実際の契約・課金条件は利用するAPIプランで確認します。

この「1,000文字あたり」の数字を、Web版の月額料金として読まないでください。また、日本語1,000文字が必ず何分になる、という換算もしません。同じ文字数でも、読み方や間の取り方、原稿の内容で音声の長さは変わります。
期間限定の割引は、試すきっかけにはなります。ただ、来月も使いたいかは通常条件で考えたほうが落ち着いて判断できます。発表の勢いに合わせて長い企画を始めるより、まず一本を作って、原稿の手直しにどれだけ時間がかかるかを見るのがおすすめです。
最初の一本は「誰に、何を伝えるか」を一つに絞る
AI音声を触る前に、ひと言だけ決めておきたいことがあります。聴いた人に、何を一つ持ち帰ってほしいか。 ここがぼんやりしていると、声が自然でも、内容がなかなか伝わりません。
たとえば、お店の短い紹介なら「新しいメニューがある」、作業の説明なら「最初に押すボタンが分かる」、風景の動画なら「この場所で少し休みたくなる」。目的はそんな小さなことで十分です。一本に商品の特徴も歴史も料金も全部詰め込むと、読む側も聴く側も忙しくなります。
次に、声の役割を考えます。画面にすでに大きく出ている文字を、声でもすべて繰り返す必要はないかもしれません。映像だけでは分かりにくい理由や、次に見る場所をひと言足す。ナレーションは、画面の説明を増やすだけでなく、見る人を案内するためにも使えます。
ここからの原稿例は、この記事のために作った架空の作例です。実在する商品や店舗の案内ではなく、Eleven v4で生成して品質を検証した音声でもありません。読者のみなさんが、自分の内容へ置き換えて試すためのたたき台として使ってください。
たとえば「新しいマグカップを紹介したい」なら、最初の原稿はこう考えられます。
朝のコーヒーを、少しゆっくり。
手になじむ、小さなマグカップを作りました。
窓辺に置くと、やわらかな青がよく見えます。
今日のひと息に、いかがでしょうか。
この例では、サイズや価格を無理に入れていません。まず、どんな場面に似合う物かを伝える構成です。もし目的が購入前の比較なら、素材や容量など、実際に確認した情報を入れる原稿に変えます。雰囲気を伝える動画と、判断材料を伝える動画では、必要な言葉が違います。
声を選ぶ前から、完璧な台本に仕上げなくても大丈夫です。声にしてみると、文字で読んだときは気にならなかった言葉の重なりが見つかることがあります。まず短く書き、聴いてから直す。この往復を前提にしておくと、最初の一本に取りかかりやすくなります。
Webで始める手順。原稿・声・モデルの順に確認する
公式のText to Speechガイドでは、文章を入力し、声を選び、必要に応じて設定を調整して生成する流れが案内されています。画面の配置は変わることがあるので、ボタンの位置より「Text to Speech」「Voice」「Model」という名前を手がかりにすると探しやすいです。
1.短い日本語原稿を用意する
最初は一つの段落で十分です。タイトルやメモ、読み上げてほしくない注釈を混ぜず、声にしてほしい文章だけにします。メールアドレスや長いURLを説明文の末尾に貼るより、「詳しくは画面のリンクから」のように、聴く人が理解しやすい言い方を考えましょう。
2.Text to Speechで声を選ぶ
声の見本を聴き、自分の動画に合う候補を選びます。最初から何十種類も比べると、違いが分からなくなりがちです。落ち着いた候補と、少し明るい候補の二つくらいから試す、というのが私の提案です。性別や年齢のイメージだけでなく、話すテンポや語尾にも耳を向けてみてください。
3.モデルがEleven v4か確認する
サービスを開いただけで、必ず目的のモデルが選ばれているとは限りません。生成前にModelの表示を見ます。古い解説を読んでいると別モデルの設定が出てくることもあるので、今回使う名前がv4であることを先に確認しましょう。
4.まず少ない指示で生成し、聴く
初回は声と原稿の相性を見るために、凝った指示を増やしすぎないことをすすめます。生成できたら、最初の一文だけでも聴いてみる。違和感があれば、声か原稿か、変えるものを一つ決めて、同じ部分を比べます。
5.良い候補を残し、ダウンロードする
音声を選んだら、ダウンロードします。公式ヘルプでは、生成直後のダウンロードボタン、またはText to Speechの履歴から保存する方法が案内されています。履歴ではMP3やWAVなどの選択肢を確認できます。利用する編集アプリが扱いやすい形式を選んでください。
ファイルを保存できたら、音声だけを聴く段階と、動画に入れて見る段階を分けます。音声だけならちょうどよい間でも、映像では少し長く感じることがあるからです。完成した音声を、そのまま完成した動画と考えなくて大丈夫です。
声の選び方。「好きな声」と「伝わる声」を聴き比べる
声を選ぶとき、見本の一文が素敵だと、そのまま使いたくなります。でも、本当に聴いてほしいのは自分の原稿です。見本が合っていても、数字の多い説明や、静かな風景の紹介に合うとは限りません。
私なら、候補の声を同じ短い原稿で比べます。片方だけ違う原稿を読むと、声が好きなのか、文章が好きなのか分かりにくいからです。まず同じ一段落を使い、最初の印象を短くメモしておく。「やさしいけれど少し眠い」「明るいが案内には強すぎる」くらいの言葉で十分です。
次に、見る人の場面を想像します。通勤途中にスマホで見る動画なのか、仕事の操作を確認する説明なのか、休日にゆっくり楽しむ映像なのか。静かな映像に大きな声を重ねるより、画面の空気に合わせた声のほうが、最後まで見やすいこともあると思います。
個人的には、最初から「すごく人間らしく聞こえるか」だけを目標にしないほうが、選びやすいと感じます。肝心な一文が聞こえるか。早口で置いていかれないか。語尾が内容に合っているか。こうした具体的な点のほうが、直す場所を見つけやすいからです。
声を比べるときは、音量もそろえて考えたいところです。大きい声は、それだけで印象に残ることがあります。再生する機器や音量をころころ変えず、同じ条件で聴く。厳密な音質測定ではありませんが、候補選びを落ち着いて進める助けにはなるはずです。
選んだ声が少し違ったら、原稿にたくさん指示を足す前に、もう一つの候補を聴いてみる。文章を無理にねじ曲げるより、声を変えるほうが早く方向をつかめる場合もあります。設定の細かさより、最初の組み合わせを大切にしたいです。
音声タグとは?まずは一つだけ入れてみる
v4では、角括弧の中に短い指示を入れる「音声タグ」が使えます。公式は、ささやきや笑いなどの表現、原稿中の話し方の指示を紹介しています。タグは、読み方をAIへ伝える手がかりです。すべての指示が必ず同じように反映されるわけではありません。
出典:Eleven v4専用ガイド / 公式の原稿・音声タグ・発音ガイド
最初は、一つの指示だけで違いを見てみましょう。次は、架空の風景紹介の原稿です。「落ち着いて読む」という短い英語の指示を、冒頭に添える案にしています。指定したとおりの音声になるかは、実際に生成して聴いて確認する必要があります。
[calm, measured]
少し歩くと、川の音が近づいてきました。
橋の上で、ひと休み。
今日は、急がず帰ろうと思います。
比べる相手は、同じ文章からタグを外した版です。「指示あり」「指示なし」の原稿を用意して、どちらが映像に合うかを聴きます。タグを入れたほうが良い、という前提にはしません。もともと落ち着いた声なら、足さない版のほうが自然に感じるかもしれません。
逆に、すべての行へ「明るく」「驚いて」「ゆっくり」「ささやいて」と詰め込むと、自分でも何を比べたいのか分からなくなります。原稿の中で、雰囲気を変えたい一か所を決める。指示はそこから増やすほうが、良し悪しを判断しやすいでしょう。
私の好みとしては、短い案内で笑いや大きな感情を入れるときほど慎重にしたいです。楽しい表現が似合う動画もありますが、問い合わせ先や料金の説明に演技が多いと、聞く人の注意が内容からそれることもある。声の表情は、文章の目的に合わせて選びたいと思います。
タグは魔法の言葉ではありません。欲しい読み方を短く伝える道具です。「このタグが最強」と覚えるより、同じ原稿で一つずつ比べる習慣のほうが、新しいモデルにも対応しやすくなります。
読む文章を、聴く文章へ。語尾と一文の長さを整える
文字で読んで自然な文章でも、声にすると少し重くなることがあります。画面なら読み戻せますが、ナレーションは次の言葉へ進んでいきます。伝えたいことが一文に多いほど、聴く側はついていくのが大変です。
たとえば、次の架空の説明を見てください。内容は分かりますが、声で一度聴くには少し長めです。
本商品は、日常使いに適した軽量な設計でありながら、
持ち運びや保管のしやすさにも配慮した仕様となっております。
同じ方向の説明なら、私はこんなふうに整理します。
毎日使いやすい、軽い作りです。
持ち運ぶときも、しまうときも、場所を取りにくくなっています。
ここで大事なのは、実際の商品の特徴を確認してから書くことです。この例の「軽い」「場所を取りにくい」は、架空の商品を前提にした表現の練習です。自分の紹介文に置き換えるときは、重さや寸法など、確かめられる情報と矛盾しないようにします。
文章の直し方としては、まず「〜により」「〜であるため」「〜を通じて」が続いていないか見ます。説明同士のつながりを、一つの長い文で全部表そうとしていないでしょうか。言いたいことを二つに分けるだけで、声にしたときの息継ぎを考えやすくなります。
語尾も、すべて「〜となっております」でそろえる必要はありません。丁寧さは大事ですが、同じ語尾が続くと、案内を聞いている感じが強くなることもあります。「〜です」「〜してみてください」「〜が見えます」と内容に合わせて変えると、原稿の流れを作りやすいでしょう。
ただし、話し言葉にするために、事実をぼかさないことも大切です。「たぶん便利」「きっと安心」のような言葉へ置き換えるより、何ができるかを短く書く。やわらかい文章と、あいまいな説明は同じではありません。
最後に、自分でも一度、小さな声で読んでみるのがおすすめです。途中で息が切れる場所、同じ言葉を二度言っている場所、口に出すと少し照れる表現。そうした気づきを原稿へ戻してからAI音声にすると、比べるべき点がはっきりします。
日本語で気をつけたい数字・人名・英語の読み方
日本語の原稿で、特に聴き直したいのが数字と固有名詞です。日付、時刻、料金、商品名は、音が少し違うだけでも伝わる内容が変わります。雰囲気が良くても、ここは別に確認しましょう。
公式の原稿作成ガイドも、数字や記号、略語などの読みを確認することをすすめています。v4はIPAという発音記号を原稿中に使う方法も紹介していますが、初めての短い日本語原稿なら、まず普通の言葉で読みを明確にするところからでよいと思います。
| 画面の表示例 | 音声原稿で試す読みの例 | 聴き直すポイント |
|---|---|---|
| 4/1 | しがつ、ついたち | 日付を意図した場合の例。文脈を確認 |
| 税込3,300円 | 税込、さんぜんさんびゃくえん | 税区分と金額の両方を確認 |
| 10:30 | 午前、じゅうじ、さんじゅっぷん | 午前・午後は実際の案内に合わせる |
| AI | エーアイ | 同じ原稿内で読みが変わらないか |
| 人名・店名 | 本人・店舗が確認した読みへ置き換える | 推測で決めず、前後の文も聴く |
スマホでは横にスクロールしてご覧ください。
表の読みは、この記事の架空の案内を想定した例です。「4/1」を日付として読むのか、割合として読むのかは、文脈で変わります。人名の読みも本人に確認し、慣れた読み方を勝手に当てはめないでください。
私なら、公開する原稿と、音声に渡す原稿を分けて保存します。字幕では「税込3,300円」が見やすくても、声の原稿では「税込、さんぜんさんびゃくえん」としたほうが意図を伝えやすい場合があります。表示用の数字まで全部ひらがなに変える必要はありません。
英語の略語も同じです。「AI」「API」「FAQ」が、想定した読み方になっているか聴きます。聞く人が専門用語に慣れていないなら、略語を正しく発音させるだけでなく、「音声を作る仕組み」のように言い換える選択もあります。
ひらがなへ置き換えても、狙ったアクセントまで必ず整うとは限りません。だからこそ、読み方を直した一文は、前後と一緒にもう一度聴く。単語だけでは良くても、文の流れでは違和感が出るかもしれません。
間違えると困る情報を、先に三つだけメモしておく。 たとえば「店名」「価格」「受付時間」。その三つを重点的に確認してから、全体の雰囲気を選ぶ。短い原稿でも、確認する順番を決めると、感覚だけで候補を選びにくくなります。
架空の作例1:お店の紹介は、欲張らないほうが伝わる
ここでは、架空の小さな書店を紹介する短い動画を考えてみます。実在する店舗の事例ではなく、商品や営業時間についての事実を伝えるものでもありません。目的は、「帰り道に寄ってみたい」と思える入口を作ることです。
原稿の最初から「地域に根ざした豊富な品ぞろえと快適な空間を提供する」と書くと、伝えたい魅力が少し遠くなります。どんな瞬間がある場所なのか、一つだけ切り取ってみましょう。
帰り道に、少しだけ寄り道。
棚をゆっくり眺めていたら、気になる一冊が見つかりました。
読み始める前から、ちょっと楽しい。
そんな時間のある、小さな本屋です。
この原稿で私が残したいのは、「気になる一冊が見つかりました」の一文です。映像で本を手に取る場面があるなら、その動きと声を合わせられます。ナレーションが先に全部説明してしまうより、見る人にも一緒に見つけてもらう余白を残したいです。
声の候補は、落ち着いた読みと、少し会話に近い読み。最初から元気な宣伝調を指定するより、映像が持つ静けさに合わせて比べます。タグを使うなら、原稿の冒頭に一つだけ穏やかな方向を添える案が考えられますが、タグなしも候補に残しましょう。
もし本当の店舗紹介に使うなら、最後に店名や場所を入れることになるでしょう。その情報は、実際の店に確認した内容へ置き換えます。雰囲気のよい原稿でも、架空の読みをそのまま営業案内へ流用しないことが大切です。
この例が合わない店もあります。活気のあるイベント紹介なら、もう少しテンポのよい文章が似合うかもしれません。原稿を真似するより、自分の場所で何を感じてほしいかを考える。その違いが、声を付けたときの個性にもなると思います。
架空の作例2:説明動画は、一回聴いて分かる順番に
次は、架空の保存機能を説明する動画です。ここでのボタン名や操作は実際の製品の手順ではありません。見る人に「次に何をするか」が伝わる原稿を考えるための例です。
入力が終わったら、右上の「保存」を押します。
「保存しました」と表示されたら、ここまでの作業は完了です。
続けて編集したい場合は、この画面のまま進めてください。
説明動画では、親しみやすさを足す前に、順番をそろえたいです。「便利に保存できます」と良さを先に言うより、見る人が探しているボタンを先に示す。操作、確認できる表示、次の行動。この順番なら、声と画面を合わせて考えやすくなります。
一文の中に「押して、確認して、戻って、選び直して」と動作を増やしすぎると、視聴者は途中で止めたくなるかもしれません。実際の手順が多いなら、原稿も区切ります。短くするために必要な操作を省くのではなく、説明する単位を小さくする考え方です。
ここで選びたい声は、私は「落ち着いていて、言葉の区切りがつかみやすい声」です。大きな感情の変化より、ボタン名がきちんと聞こえることを優先します。設定をいくつも動かす前に、そのボタン名を含む一文だけ聴いてみましょう。
完成した音声を映像に合わせるときも、操作の途中で次の説明へ進んでいないか確認します。ナレーションの速度を変えてすべて押し込むより、画面を見せる時間を伸ばすか、文章を二つに分けるほうが親切な場合もあります。
説明動画の原稿づくりでは、文章の上手さより「迷わず同じ作業ができるか」を大切にしたいです。AI音声がきれいでも、見ている人が違うボタンを押したくなる説明なら、原稿へ戻ります。声を付ける工程は、手順の分かりにくさを見つける機会にもなります。
架空の作例3:短い声だからこそ、最後の一文を選ぶ
短い動画では、最後の一文が少し気になることがあります。「ぜひチェックしてください」「今すぐご覧ください」が続くと、どんな動画も同じ終わり方になってしまう。内容に合わせて、終わり方も選んでみましょう。
たとえば、架空の机の片付け動画なら、こんな原稿が考えられます。
机の上から、一つだけ物を減らしました。
空いた場所に、今日使うノートを置きます。
全部を片付けなくても、始められる日があります。
この例なら、最後は強い呼びかけにしないほうが、静かな映像には合うと思います。反対に、イベントの申込方法を伝える動画では、「申込みは画面のリンクから」と次の行動を明確にしたほうが親切でしょう。雰囲気を大切にすることと、必要な案内を省くことは別です。
終わり方を決めると、冒頭も整えやすくなります。最後に一つ行動してもらいたいなら、最初から説明を絞る。景色を楽しんでもらうなら、冒頭で場所の空気が伝わる言葉を置く。短い原稿でも、始まりと終わりを並べてみると、一本の流れが見えてきます。
声の候補を比べるときは、最後の語尾まで聴きます。最初の一文が良くても、締めくくりが強すぎると、動画全体の印象が変わります。逆に、最後の大切な言葉が小さく消えてしまうなら、内容に合わせて原稿や声を見直したいところです。
「もっと自然に」という指示だけでは、直したい場所が伝わりにくいことがあります。「最後は言い切る」「ここだけ急がない」と、自分が気になった箇所を言葉にする。その具体性が、次に試す原稿を考える助けになります。
v4の設定で迷ったら。古い解説との違いも確認
v4の専用ガイドで案内されている声の設定は、StabilityとSimilarityの二つです。Stabilityは表現の変化と安定感、Similarityは元の声への近さを調整するものとして説明されています。最適な値は、声と原稿、欲しい表現によって変わります。
同じガイドでは、v4にStyleとSpeedのスライダーはなく、SSMLにも対応しないと案内されています。古いモデル向けの記事にある速度スライダーや、休止を指定するXMLのタグを、そのままv4の手順だと考えないでください。
私なら、設定を触る前に、今の出力で何が気になるかを短く書きます。「声の雰囲気が違う」「一文が長い」「重要な言葉が速い」。この三つでは、見直す場所が違います。声の雰囲気なら別の声、一文の長さなら原稿、読み方ならタグや設定が候補になります。
変更するときは一つずつ。声も原稿も設定も一度に変えると、改善しても理由が分かりません。値を少し変えた版を作るなら、元の版も残して同じ一文を聴く。自分で比較できる状態を作ることのほうが、誰かの数値をそのまま真似するより役立つと思います。
とくに「速すぎる」と感じるときは、まず詰め込んだ説明を見直してみてください。Speedのスライダーを探す前に、一文を二つに分ける、不要な修飾語を減らす、映像に任せる情報を決める。文章そのものが軽くなると、欲しい話し方も考えやすくなります。
何回も生成して選べなくなったら、いったん最初の版へ戻るのも一つです。少しずつ豪華な表現へ寄せているうちに、最初に伝えたかったことから離れる場合があります。良い候補を一つ残すことも、編集の大事な判断だと思います。
自分の声を使える?最初は声のライブラリでも十分
v4は、短い録音から声の特徴を使うInstant Voice Cloningと、より多くの録音を使うProfessional Voice Cloningに対応しています。自分の声で続けたい動画があるなら、気になる機能でしょう。
ただ、最初の一本に必須ではありません。声のライブラリから候補を選び、原稿との相性を見るだけでも始められます。声を録り直す作業と、原稿を直す作業を同時に増やすより、まず完成までの流れを知るほうが、取りかかりやすいと思います。
Professional Voice Cloningの公式ガイドでは、自分自身の声を確認する手続きがあり、他人の声を本人の同意だけで自分のアカウントに作ることはできないと説明しています。本人が自分のアカウントで作成・確認して共有する仕組みは別にあります。録音が手元にあることだけで、使ってよいとは判断しません。
出典:Professional Voice Cloningの公式ガイド
自分の声を使う場合、私は最初に「どんな話し方を続けたいか」を考えたいです。普段の会話の声で短い紹介を作りたいのか、落ち着いて読んだ声で説明を続けたいのか。原稿の目的が見えてから録音を準備したほうが、残したい特徴を選びやすくなります。
また、v4専用ガイドは、同じ言語では元の声のアクセントを保ち、別の言語ではその言語に合わせたアクセントを使うと説明しています。他の言語でも元のアクセントがそのまま残る、と一律に考えないほうがよさそうです。
「自分の声に近い」と「自分が好きな仕上がり」も、少し違います。本人らしさを残したい箇所と、聞き取りやすく整えたい箇所を分けて考える。好きな候補を選ぶときは、似ているかだけでなく、伝えたい内容に合うかも聴いてみてください。
無料の音声を仕事で使える?公開前に確認したい条件
ここは、料金より先に知っておきたい部分です。公式ヘルプによると、Freeは商用ライセンスを含まず、商用目的には使えません。無料で作った音声を非商用で公開する場合も、タイトルに「elevenlabs.io」または「11.ai」を入れる帰属表示の案内があります。
有料プランは、Beta Servicesなどの例外を除いて商用ライセンスを含みます。ただし、必要な権利を持つ素材を使い、規約や各サービスの条件に従うことが前提です。「有料なら誰の声でも、どんな内容でも使える」という意味ではありません。
とくに覚えておきたいのは、生成した時期です。公式ヘルプは、有料契約中に生成した内容の商用利用と、無料期間に生成した内容を区別しています。後から有料へ変更するだけで、無料時代の音声が商用利用できると考えないでください。
私なら、仕事で使う音声には「作成日」「利用時のプラン」「原稿の最終版」を一緒に残します。細かな契約の解釈を自分で増やすためではなく、その音声をどう作ったかを後から確認できるようにするためです。短い一本でも、記録があると作り直す判断がしやすくなります。
使う場面も先に決めておきたいところです。自分だけで試す音声なのか、会社の紹介動画なのか、依頼を受けた広告なのか。同じ原稿でも、使い方が変われば確認する条件が変わることがあります。曖昧な場合は、公開前に公式の利用条件と契約画面を確認します。
素材の権利は、音声の契約とは別です。自分で書いた原稿でも、他人の文章をそのまま入れていないか、使う録音が自分のものかを確認します。AI音声を入れたことによって、動画に使う写真やBGMの条件まで解決するわけではありません。
動画に入れたら、3回だけ違う聴き方をしてみる
気に入った音声ができたら、最後は動画の中で確認します。私は、確認の目的を三つに分けると、延々と候補を作り続けることを防ぎやすいと思います。これは音質の実測ではなく、公開する候補を選ぶための編集の提案です。
一回目は、原稿を見ずに聴きます。内容が頭に残るか、途中で速すぎると感じないか。「何の案内だったか」を自分の言葉で言ってみてください。文章を知っていると、聞こえていない言葉まで補ってしまうことがあるので、まず耳だけで確かめます。
二回目は、原稿を見ながら聴きます。人名、金額、日付、ボタン名など、間違えると困る部分を照らします。大事な数字だけ声が薄くなっていないか、同じ単語を違う読み方で言っていないか。声の雰囲気とは別に、内容の正しさを見ます。
三回目は、映像と一緒に見ます。指で示している場所と声が合うか、字幕を読む時間があるか、最後の声が映像の途中で切れていないか。音声だけなら問題がなくても、動画に置くと調整したい場所が見つかるかもしれません。
BGMを使うなら、それを重ねた状態でも確認しましょう。静かなところで音声だけを聴いて大丈夫でも、音楽の上では言葉が埋もれることがあります。私は、音楽を先に大きくするより、説明の一文が無理なく聞こえるところから音量を決めたいです。
スマホで見る予定の動画なら、スマホのスピーカーでも一度確認しておくと安心です。厳密な音響検査ではありませんが、読者が使う場面に近い形で「聞き取れるか」を見られます。聴く機器を変えたら、設定まで同時に動かさず、気になった場所をメモしてから直します。
そして、全部を直そうとしなくて大丈夫です。内容に関係しない小さな好みを追い続けるより、大事な言葉が伝わる候補を選ぶ。声の完成度と、動画を出せる状態の間で、納得できる地点を見つけたいと思います。
AQUAの見方:AI音声の価値は、原稿を聴き直せることにもある
今回のv4で私が注目したいのは、「人の声と区別できないか」という話だけではありません。声の候補を作り、自分が書いた言葉を耳で確認する。その往復がしやすくなることにも、価値があると思っています。
文章を書いていると、伝えたいことを足しすぎることがあります。声にすると、同じ説明が重なっている場所や、長くて息継ぎしにくい場所が分かる。AI音声を最終素材として使わなくても、原稿を見直すための仮の読み上げとして役立つ可能性があります。
一方で、感情を細かく付けられるようになったからといって、すべての文章に演技を足したいわけではありません。料金や手順を伝える場面では、静かに、はっきり読まれることがいちばん親切な場合もある。表現の選択肢が増えたときほど、「ここに必要か」を考えたいです。
私は、良いナレーションは、聴く人に余計な負担をかけないものだと思います。声の存在を強く印象づけたい作品もありますが、短い案内なら、内容へ自然に目が向くことを優先したい。魅力的な声を見つけることと、魅力的な動画にすることは、少し違う仕事です。
新しいモデルを選ぶときも同じです。ランキングで上にいるから乗り換えるより、今の原稿で困っている一か所が改善するかを見る。たとえば、店名が聞き取りやすくなったか、説明の語尾が落ち着いたか、同じ声でシリーズを続けやすいか。そうした小さな変化のほうが、自分にとっての価値を判断しやすいはずです。
ここで述べたのは、公式資料を読んだうえでの編集・原稿づくりの意見です。本記事ではEleven v4の日本語音声を生成して比較する実測は行っていません。声の仕上がりを断言する代わりに、読者のみなさんが自分の一文で確かめられる進め方を提案しています。
よくある質問
Eleven v4は無料で試せますか?
公式は無料で始められると案内しています。Freeの月間枠は10,000クレジットです。商用ライセンスは含まれないので、仕事に使う音声は生成前にプランと条件を確認してください。
日本語ナレーションなら、v4とTurboのどちらを選びますか?
録画した動画に入れる声なら、まずコンテンツ制作向けのv4が候補です。Turboはリアルタイム会話向け。どちらも、自分の原稿で読みと声の雰囲気を確認します。
Creatorは毎月11ドルですか?
9月29日の月払い表示では、通常22ドル、初月50%割引で11ドルです。年払いの月換算額や税別表示とも分けて、契約直前の画面を確認します。
音声タグを入れれば、必ず自然になりますか?
タグは読み方の指示を伝える手がかりで、仕上がりの保証ではありません。同じ原稿のタグあり・なしを比べ、映像に合うほうを選ぶのがおすすめです。
v4の速度スライダーはどこにありますか?
v4専用ガイドは、SpeedとStyleのスライダーはないと説明しています。まず原稿の長さと区切りを見直し、必要な読み方の指示を一つずつ試します。
無料で作った音声を、後から有料契約して商用に使えますか?
公式ヘルプは、無料期間と有料契約中の生成を区別しています。有料へ変更するだけで、以前の無料音声が商用利用できるとは考えません。公開前に公式の条件を確認してください。
この記事の日本語例は、Eleven v4で試した結果ですか?
いいえ。この記事の例は、原稿づくりを説明するための自作の架空例です。日本語音声を生成した性能比較や実測は行っていません。仕様と料金は公開された一次資料を確認しています。
今日試すなら、まず一段落を声にしてみる
Eleven v4は、文章の内容だけでなく、読み方まで考えたい方にとって気になる新しい音声AIです。9月28日の発表とXでの反響は、試してみるきっかけになります。ただ、自分の日本語原稿に合うかは、ランキングではなく、その原稿を聴いて決めるのがよいと思います。
最初は、一段落を用意し、声を一つ選び、モデルがv4か確認して生成する。タグは必要なところへ少しずつ。読みが気になる数字や名前を直し、最後に映像と一緒に見る。この順番なら、難しい設定を全部覚えなくても始められます。
料金は通常の月額と初月割引、アプリ特典とAPI割引を分けて確認してください。仕事で使う音声なら、生成する前にプランと利用条件を決めておきます。好きな声ができてから、条件を考えるよりも進めやすいでしょう。
声を付けると、いつもの文章が少し違って聞こえます。短くしたほうが伝わる一文も、残したくなる言い回しも見つかるかもしれません。まずは、自分が誰かに伝えたい一段落から。そこから始める一本が、いちばんあなたらしい試し方だと思います。
あわせて読みたい記事
参考資料・確認日
情報は2026年9月29日時点。仕様・料金・特典・利用条件は変更される場合があります。公開画面の部分スクリーンショットは本文の説明箇所へ配置しました。日本語の原稿例と編集の提案はAQUA独自のもので、音声生成の実測結果ではありません。
カバーはAIで作成したイメージイラストです。ElevenLabsの実際の操作画面や製品の使用を撮影した写真ではありません。
本文で参照した一次資料を開く
最終更新: