【AIニュース 9/29】声が10秒で世界語る — 今日の注目9選
サムネイル情報
—
こんにちは、まこっちです。今日は9月29日、火曜日ですね。
今日はこれが面白くて——ElevenLabsが、10秒の声サンプルだけで自分の声のクローンを作って、それを90言語以上でしゃべらせられるようになったんですよ。日本語で録音した声が英語でしゃべる。コンテンツ制作者にとっては、これ、かなりインパクトあるんじゃないかなと思って。
今日のAIニュースは9本。講師・コンテンツ制作者目線で深掘りしていきます。
—
1. ElevenLabs Eleven v4登場 — 10秒の声サンプルで、90言語をネイティブ発音でしゃべれる
📺 画面表示用
ElevenLabsの新しい音声AIモデル「Eleven v4」が登場しました。何がすごいかというと、10秒の音声サンプルだけで声のクローンが作れるんですよ。しかもその声が90言語以上でしゃべれて、それぞれの言語でネイティブっぽい発音になる。日本語で録音した声を英語でしゃべらせても、英語ネイティブのアクセントで話してくれる、みたいな感じです。あと、テキストに感情の指示を埋め込めるようになっていて、「怒ったように」「フランス語アクセントで」「笑いながら」みたいな指定ができるようになりました。リアルタイム通話に使いやすい低遅延バージョン「v4 Turbo」も出ていて、こちらは反応が0.1秒くらいと、体感的にほぼ待ち時間がないレベルです。
講師として自分の声で講座を作っている方は、これを使うと英語版・中国語版のナレーションが自分の声のまま出せるんですよね。「海外展開したいけど吹き替えコストが…」という方にとって、かなり現実的な選択肢になってきたと思います。まずElevenLabsの無料プランで10秒試しどりして、声のクローンを作ってみるといいんじゃないかなと思います。
—
2. ChatGPT Voiceにプラグインが対応 — メール・カレンダー・Slackを声で操作できる
📺 画面表示用
OpenAIがChatGPT Voiceにプラグイン連携を追加しました。これまでは「しゃべって会話できる」だけだったんですが、連携済みのメールやカレンダー、Slackなどのアプリを声で動かせるようになったんですよ。「来週の月曜に会議を入れておいて」って声で言えば、実際にカレンダーに入る、みたいなイメージです。さらに「ChatGPT Work」という文書・資料を作る機能でも、Voiceが使えるようになりました。話しながら指示するだけで、Word形式の文書や、スライド、スプレッドシートを作ってくれる。通話中にタスクが終わらなくても、電話を切った後にテキストで続きを進めてくれるので、途中で中断してもOKなのが地味に便利だなと思います。
移動中や家事をしながらでも、スケジュール管理やメール確認が声一本でできるようになるので、隙間時間の使い方がかなり変わってきますよね。「コーチングセッションの後、すぐに次のアポを入れたい」みたいなシーンで、スマホを取り出さずに済む。ChatGPT Plusを使っている方は、どのプラグインと連携できるか確認してみる価値があると思います。
—
3. OpenAI DevDay 2026 — Managed AgentsとAeon常駐エージェント発表
📺 画面表示用
今日、OpenAIの開発者向けイベント「DevDay 2026」がサンフランシスコで開かれました。一番注目されていたのが、「Managed Agents」っていう新しい機能なんですよ。これは、AIエージェント——指示すると自分で段取りして動いてくれるAI——を、自分のサービスに組み込みやすい形で提供する仕組みで、環境の設定からツールの選択まで、プラットフォーム側でまとめて面倒を見てくれる。要は、AIに複雑な作業を任せるときの「設置と管理」が、ぐっと楽になるよねっていうイメージです。もう一個気になるのが「Aeon」というコードネームで呼ばれている常駐エージェント。チャットを閉じても作業を続けてくれる、ずっとそこにいるAIアシスタントなんですよね。API料金の速度ティアも3段階(Standard・Fast・Ultra-Fast)で使い分けられるようになるらしくて、これはコスト管理がしやすくなりそうです。
コンテンツ制作に自動化を取り入れたい方にとっては、Managed AgentsはAPIを触らなくてもエージェントをサービスに組み込める入口になってきますよね。今すぐ動くものというより「こういう方向に来てるんだな」という流れの把握として、DevDayのレポート記事を一本読んでおくといいんじゃないかなと思います。
—
4. Gemini 3.8 Flash TTS — テキスト1行で声が作れる、2000種以上のボイスライブラリ
📺 画面表示用
GoogleのGemini 3.8 Flash TTSとFlash-Lite TTS——TTS(テキスト読み上げAI)です——が正式リリースされました。一番面白いのが「Voice Design」という機能で、「落ち着いた女性のナレーション声で、少し速めにしゃべる感じ」みたいにテキストで指示するだけで、オリジナルの声が生成できるんですよ。選べる声は2000種類以上。メキシコスペイン語やケベックフランス語、スコットランド英語みたいな方言・地域バリエーションまで100言語以上をカバーしています。あと、30秒の音声サンプルから声をコピーする「Voice Replication」機能もあります。Hume AIのVoice Design Benchmarkで1位を取っていて、音声AIの使い勝手がかなり上がってきた感じですね。
声のデザインをテキスト一行で指定できるのが面白くて、「自分の声そのままでなくていいけど、ブランドっぽい声がほしい」という方に向いているんですよね。Googleの無料枠を使って、まず自分の講座のナレーション向けにどんな声を作れるか試してみるといいんじゃないかなと思います。ElevenLabsと並べてみると、用途の使い分けが見えてくると思います。
—
5. Gemini × Google Mapsが深く統合 — 場所を聞くと地図表示・電話・ナビまで一気にできる
📺 画面表示用
GoogleのSeptember Android Dropで、GeminiとGoogle Mapsの連携が大きく進んだんですよ。「近くのカフェを探して」と言うだけで、そのまま地図が開いて、候補が表示されて、「ここに電話して」って言えば発信まで一気にできる。あと、「僕のパスポート、寝室の引き出しに入れておいて」ってGeminiに言うと、Find Hub(紛失物を管理するアプリ)に保存してくれる「Remembered Items」機能も搭載されました。スマホを置き忘れた・大事なものをどこに置いたか忘れた、みたいなことを声で管理できるようになった感じですね。さらに「Gemini Live」のガイド機能が、暗い場所や細かい文字を声で説明してくれる機能としてAndroid 9以降に広がりました。
出張やセミナー会場への移動が多い講師・コーチの方には、「会場近くのランチどこがいい?」「タクシーを呼んで」が一連の流れでできるのが地味に使いやすいと思います。Androidユーザーの方は最新版にアップデートして、Gemini LiveとMaps連携が動いているか確認してみてください。
—
6. Claude Sonnet 5.5リリース — 30%速く、同じ価格でできることが増えた
📺 画面表示用
AnthropicがClaude Sonnet 5.5を出しました。価格はSonnet 5と同じ——入力100万トークンあたり2ドル、出力10ドル——なんですけど、速度が30%以上アップして、1回の作業に使うトークン数も減ったので、実質コストは下がるんですよね。あと、Pokémon Redっていうゲームボーイのゲームをスクリーンショットだけで最後までクリアした最初のSonnetモデルということで、長い作業を続けて進める力がついたことを証明しています。UI周りの「見た目をきれいにする」デザインセンスも上がったらしいし、見えないテキスト透かし技術も入って、AI生成コンテンツの識別がしやすくなっています。セキュリティ面では、Opus 5.5と同じ安全ガードが搭載されていて、危険と判断したリクエストには自動でSonnet 5に切り替わるようになっています。
台本を書いたり、カリキュラムを設計したりするのにClaudeを使っている方は、特に何もしなくても同じ値段で速くなっているわけなので、すごくありがたいですよね。一方で透かし技術が入ったことで、「これはAIが書いた」という識別がしやすくなってきている。自分の言葉でどう仕上げるか、という部分の価値がますます上がってくると思います。
—
7. Gemini Gems廃止 — 11月からSkillsにリニューアル、有料プラン限定に
📺 画面表示用
GoogleがGeminiの「Gems」っていう機能を終了させると発表しました。Gemsは、自分だけのカスタムAIアシスタントを作れる機能なんですけど、11月17日から「Skills」という名前の新しい仕組みに移行するんですよね。Gemsで作ったものは自動的に引き継がれるので、作り直しは必要ないんですが、問題なのは今後のSkillsがGoogleのAI ProとAI Ultraという有料プランだけになるということです。今まで無料プランでもGemsが使えていたのに、これは有料限定になる。Skillsになると何が変わるかというと、チャット欄でスラッシュ(/)を打つだけで呼び出せるようになって、ファイルやスクリプト、使い方の手順書なんかも一緒に保存できるようになります。機能的には上がるんですけど、無料ユーザーには影響が出そうですね。
Gemsでカスタムアシスタントを作って生徒に渡していた、という方は11月17日のデッドラインを意識しておいてほしいですね。引き継ぎは自動とはいえ、使えなくなる前に一度自分のGemsの一覧を確認して、有料プランが必要かどうかを判断しておくといいと思います。
—
8. Claude Marketplace — 2000超えのMCPコネクタ・プラグインが一箇所にまとまった
📺 画面表示用
AnthropicがClaude Marketplaceを正式にオープンしました。MCP——プログラム同士をつなぐ窓口みたいなもの——のコネクタやプラグインが2000本以上、一つのカタログにまとまったんですよ。AtlassianやGoogle、Microsoft、Notion、Salesforceといった大手も参加していて、Claudeからそのまま使えるツールがぐっと増えた感じです。カタログは3つのセクションに分かれていて、つなぐためのコネクタ、Claudeを使って作られたアプリ・エージェント、そしてコンサルや実装を助けてくれるパートナー企業の3種類。OpenAIのGPTsマーケットが伸び悩んだのを見て、Anthropicは「自分たちで全部作らず、外部の開発者に開放する」戦略を取ったらしいです。僕らが使っているClaude Codeも、この仕組みの上で動いていますね。
NotionやGoogle Docsを普段使いしている方は、Claudeから直接それらを操作できるコネクタが揃ってきたということなので、「台本を書いたらそのままNotionに保存」みたいな流れが現実的になってきました。claude.ai/marketplaceを一度のぞいてみて、自分が使っているツールのコネクタを探してみるといいんじゃないかなと思います。
—
9. Xiaomi MiMo-V2.6 — MITライセンス公開、オープンソース最強クラスのマルチモーダルAI
📺 画面表示用
XiaomiがMiMo-V2.6というAIモデルをMITライセンス——誰でも無料で使って改造してビジネスにも使えるライセンス——で公開しました。モデルの規模は1兆パラメータ超のMoE(Mixture of Experts)という設計で、実際に動く部分は42Bだから、効率よく動くんですよね。テキスト・画像・動画・音声のすべてに対応していて、コンテキストウィンドウが100万トークン。AIの知能を測るArtificial Analysis Intelligence Indexというベンチマークで46.32点を出して、公開されているオープンソースモデルの中でトップクラスのスコアになっています。モデルの重みだけじゃなくて、7000本以上の強化学習環境とトレーニングツールもまとめて公開していて、「これで自分のAIモデルを鍛え直せますよ」という姿勢が面白いなと思います。
「オープンソースで商用利用OK」というのは、自分のサービスにAIを組み込みたい方にとっては大きな選択肢の広がりですよね。ただ1兆パラメータのモデルを自分のサーバーで動かすにはかなりの設備が必要なので、まずは評判・ベンチマーク記事を読んで「こういうものが出てきた」という流れを把握しておくのが現実的だと思います。
—
今日の一番 — 現場に入れる1アクション
今日の9本の中で、コンテンツ制作者として「今日から動ける」という観点で選ぶなら、ElevenLabsのEleven v4ですね。
何がすごいって、10秒の声サンプルでいいんですよ。今まで声のクローンを作ろうとすると、1分とか長めの録音が必要だったりしたんですけど、それが10秒に短縮された。しかも作ったクローン声が90言語以上でしゃべれる。「日本語で講座を作ったけど、英語でも展開したい」「音声ナレーションを自分の声でやりたいけど毎回収録が大変」という方にとって、これはかなり現実的な道になってきたと思います。
今日やってみてほしいのは、ElevenLabsのサイトにアクセスして、無料プランで自分の声を10秒録音してクローンを作ってみること。テキストを入力して、自分の声で読み上げさせてみる。日本語でOKです。その体感を今日中に確認しておくと、これが自分のコンテンツ制作にどう使えるかのイメージがぐっとつかめてくると思いますよ。
—
今日のニュースは以上です。音声AIが急速に使いやすくなってきているのが、今日の全体の流れでしたね。声のクローン・TTS・Voiceプラグイン——どれも「しゃべる」体験がどんどん現実的になってきている。コンテンツ制作者としては、この波をうまく乗りこなしていきたいですよね。コメント・チャンネル登録お待ちしています。
—
この記事はAI音声コンテンツをもとに構成しています。