🎤

音声AI & 音声エージェント図解入門

に公開

はじめに

PeopleXでバックエンドエンジニアをしている本田 (@chieping) です。PeopleXではAI面接の開発をしています。

「Today I Learned -シリコンバレーの現場から-」というポッドキャストの「2025年の音声エージェント開発入門」というエピソードで知ったのですが、WebRTCのプラットフォームを提供したり、Pipecatという音声AIの対話エージェントを構築するフレームワークを開発しているDailyという会社のCEOのKwindra氏による入門記事がとてもよくできているので紹介したいと思います。

https://open.spotify.com/episode/31yLX95GkRdQInVsh21M3p

記事の概要

音声AI & 音声エージェント図解入門

https://voiceaiandvoiceagents.com/ja/

最近Today I Learned の今井さんがコントリビュートしてくれて日本語で読むことができるようになりました。ありがたい!

https://x.com/tomoaki_imai/status/1983011789085573307?s=20

記事は音声AIエージェントをやるにあたって必要な実践知――どのような技術があり、それをどう組み合わせるかであったり、この界隈にはどんなプレイヤーがいるかであったり――が広範に解説されています。音声エージェントが実用レベルになったのがOpenAIのGPT-4が出てからくらいなので、まだ日が浅く、変化が激しい界隈で、あくまで2025年の最先端のスナップショットという位置付けとなっています。

音声エージェントとは

音声エージェントとは、ユーザーと音声による対話を通じてAIがなんらかのサービスを提供するものです。

代表的なユースケースとしては、アメリカではカスタマーサポートの代替であったり、医療(病院の問い合わせであったり一時診断など)・法律分野が特にニーズが強いそうです。典型的にはこれまで電話でやっていた定型的な処理がどんどん代替されていくのでしょうか、などと思っています。

まさに2025年現在多くのスタートアップが起業するようなホットな業界で、YCombinatorの2025年のバッチでは20%が音声AIエージェント関連だったらしいです。

https://x.com/tomoaki_imai/status/1986293613698163199

イベントが毎週のように開催されるほど盛り上がっているようですね。

音声エージェントを支えるコア技術

音声エージェントが2025年現在どのようなフローになっているというと、以下の図のようになっています。

  1. 音声はユーザーのデバイスのマイクでキャプチャされ、エンコードされ、ネットワークを通じてクラウドで動作する音声エージェントプログラムに送信されます。
  2. 入力音声は文字起こしされ、LLMへのテキスト入力が作られます。
  3. テキストはコンテキスト—プロンプト—として組み立てられ、LLMによって推論が行われます。推論の出力は多くの場合、エージェントプログラムのロジックによってフィルタリングまたは変換されます。
  4. 出力テキストは音声合成モデルに送られ、オーディオ出力が生成されます。
  5. 生成された音声出力がユーザーに返送されます。

ユーザーの音声をSpeech-to-textで文字起こししてLLMに渡し、LLMからの出力をText-to-speechで音声にして再生します。なるほどわかりやすいねと思うか随分まどろっこしいことをするんだなと思うかは人それぞれでしょうか?まあともあれこのような処理を繰り返すことでサービスが成り立っています。

このようなフローを組まずとも行けるモデルとして、Speech-to-speechがあります。Speech-to-speechでは、直接音声を解釈して音声を出力できるLLMのモデルを利用することで実現できます。例えばOpenAIのリアルタイムAPIなどがSpeech-to-speech型です。

ならSpeech-to-speechを使えば面倒なフローを構築しなくてもいいじゃないかと思うかもしれませんが、Speech-to-speechにもメリデメがあり、2025年現在では本番で利用するにはまだ課題も多くこれからの技術と理解するのがよさそうです。Speech-to-speechの課題として大きいのは、音声を直接扱うことによりコンテキストサイズを多く使うことであったり、テキストを扱うモデルに比べて音声モデルは学習量が少なく、専門用語などの語彙が弱いことがあります。今後Speech-to-speechモデルが実用されるようになっていくのか、これまで通りのTTS, STTのパイプライン処理が主流のままとなるかはまだわかりません。

さて、先述のフローを構築するためにSpeech-to-textやText-to-Speech、VAD(Voice Activity Detection/音声活動検出)などのコア技術があります。

Speech-to-textやText-to-SpeechはDeepgramやGladia、ElevenLabsといった特に音声に強みを持つスタートアップのプレイヤーがいる一方、OpenAIやGeminiといった基盤モデルを提供するプレイヤーでもSpeech-to-text, Text-to-speechに対応するモデルが利用できます。詳しくは元記事を参照いただきたいのですが、今日現在では音声特化のスタートアップのほうが品質面では有利です。

Geminiなどは載っていませんが、音声AIの評価・管理ツールを提供するCovalが公開しているText-to-speech / Speech-to-text のベンチマークサイトがわかりやすいのでこれも紹介します。

https://benchmarks.coval.ai/

ベンチマークサイトでは、主要な製品ごとのTTFA (Time to First Audio:最初の音声が返ってくるまでの時間)、TTFT (Time to First Token:最初のトークンが返ってくるまでの時間)やWER (Word Error Rate)など、レイテンシや正確さを15分ごとに継続的に計測した結果を見ることができます。

記事を読んでの感想

PeopleXが提供しているAI面接では黒須ミライというアバターのAI面接官とZoomを使ったオンライン面接のように面接をすることができるサービスとなっていて、まさに音声AIエージェントという分類に当てはまるので、入門記事は興味深く読むことができました。「ああ、業務でこれやってるわ…」みたいなことがいくつも出てきて、最初にこれ読んで始めたら大分楽だったろうなあ…と思いました。私はAI面接の初期開発メンバーではなかったのですが、初期に手探りでこれを構築した面々には足を向けて寝られないです。

その他箇条書き:

  • 今後技術の進化が間違いなく速い業界であり、STT, TTS, VADなどのコア技術はユーザー体験に直結するので、常に最新の技術にキャッチアップし続けて最高のユーザー体験を提供していきたい。jagged frontier!

    ほとんどの音声AI エージェントは、OpenAI や Google(時には Anthropic や Meta)による SOTA[45] モデルを使用します。最新で最も性能の高いモデルを使用することは重要です。なぜなら音声AI のワークフローは一般にモデル能力の jagged frontier[46] の端にあり、ぎりぎりの領域で動作しているからです。

  • 例えばWebSocketとWebRTCの話などは、業務ではWebSocketを使っているのですが、WebRTCという選択肢もあるんだ、といった学びもあり少し視野が広がりました。WebRTCにするメリットもかなり大きそうです。
  • これまではユーザーに価値を提供することを第一に開発をしてきて少しなおざりになっていたところですが、LLMOps的なこともやってきたいなと。Langfuseとかが気になってましたが、CovalFreePlay、 Weights & Biases Weave などの音声に特化しているツールもあるようなので評価してみたいですね。

おわりに

音声AI & 音声エージェント図解入門 の紹介を行いました!

とてもいい入門記事で勉強になったのでこの紹介で知った、という人がいれば嬉しいです。

私が知ったきっかけになったポッドキャスト Today I Learned も有益な情報発信ありがとうございました。テックネタ好きな方にオススメのポッドキャストです!

ちなみに音声エージェントネタは他にもエピソードがありましてこちらもオススメです。

https://open.spotify.com/episode/5erMLgDhIddWj1kUYdBRxl

PeopleXでは音声エージェントのサービスを開発しています。これからも最高のユーザー体験を提供できるようプロダクトを研ぎ澄ましていきます。

PeopleXテックブログ

Discussion