音声AI

AI・機械学習

GPT-Live-1がAPIへ ― フルデュプレックス音声AIを構成と分単価から考える

OpenAIのGPT-Live-1 API発表を、音声アーキテクチャ、割り込み、バックエンド委譲、分単価の観点で実務評価します。
AI・機械学習

Gemini 3.8 Live登場―リアルタイム音声AIで確認したい設計ポイント

Gemini 3.8 Liveを、割り込み、遅延、ツール利用、Extended Thinkingとの使い分けから実務的に整理します。
AI・機械学習

OpenAI GPT-4oのマルチモーダル

本記事はGeminiの出力をプロンプト工学で整理した業務ドラフト(未検証)です。OpenAI GPT-4oのマルチモーダル機能解説OpenAIが発表したGPT-4o(オーは「omni」の略)は、テキスト、音声、視覚を単一のエンドツーエンドモ...