Gemini Live 语音模型上手:零依赖浏览器端实时语音对话

工具:双子座直播音频

谷歌今日发布了双子座3.8实时与3.8实时延伸思维——两款全新的语音到语音模型,其架构与OpenAI的GPT-Live系列相似。

我让GPT-6 Astra Extra High阅读了相关文档,并使用让它帮我做了一个网页界面试用了这些新模型。您可以选择模型和语音预设,输入可选的系统提示,然后通过浏览器开启语音对话,甚至可以在模型发言时打断它。

Screenshot of a voice chat web interface with a transcript. Top buttons: Start session, End session, Mute mic, plus a Mic level meter and a timer showing 0:33. Status: Listening. Use headphones to reduce echo. Starting a session asks for microphone access. Transcript (with Download transcript and Clear buttons). Gemini: Yes, it's working perfectly. I can hear you clearly. How can I help you today? You: Okay, this is pretty good. Tell me some interesting facts about the California brown pelica...

实现未使用任何第三方库。它连接到wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=... WebSocket端点,并利用Web Audio API中的AudioContext进行音频的采集与播放。

这是用于快速上手该WebSocket API的Gemini Live 教程

标签:谷歌工具websockets生成式人工智能大型语言模型双子座LLM发布语音转文字

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论