Gemini Live 语音模型上手:零依赖浏览器端实时语音对话
工具:双子座直播音频
谷歌今日发布了双子座3.8实时与3.8实时延伸思维——两款全新的语音到语音模型,其架构与OpenAI的GPT-Live系列相似。
我让GPT-6 Astra Extra High阅读了相关文档,并使用让它帮我做了一个网页界面试用了这些新模型。您可以选择模型和语音预设,输入可选的系统提示,然后通过浏览器开启语音对话,甚至可以在模型发言时打断它。

实现未使用任何第三方库。它连接到wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=... WebSocket端点,并利用Web Audio API中的AudioContext进行音频的采集与播放。
这是用于快速上手该WebSocket API的Gemini Live 教程。
评论
?
参与讨论