Google AI

使用 Gemini API 和 Google AI Studio 基于 Gemini 2.0 Flash、2.5 Pro 和 Gemma 构建应用。

Gemini 3.8 Live 模型文档

Google 官方文档页:介绍 gemini-3.8-live 模型,定位为低延迟语音代理/实时对话默认模型,支持交错推理、异步函数调用、整会话客户端内容更新和内置音频流。 模型规格:输入 131072 token、输出 65536 token,支持 Live API、function calling、search grounding 和音频生成,不支持 code execution、caching、image generation、structured outputs。 与旧版 gemini-3.1-flash-live-preview 迁移要点:模型字符串改为 gemini-3.8-live;thinking_level/thinking_config 不再支持;异步函数调用默认 NON_BLOCKING,可设 BLOCKING 兼容;客户端内容更新支持 user/model 角色且 turn_complete 可中断生成;proactive_audio 永久开启,设为 false 会报错;affective dialogue API 移除;turn coverage 默认包含音频与视频帧;音频为响应模态,需要文本要开转录。 更新于 2026 年 9 月。
评论点赞收藏14 天前

Gemini 3.8 Live 扩展推理音频转音频模型

Google 发布 Gemini 3.8 Live Extended Thinking,一个面向实时语音交互的高推理 audio-to-audio 模型,支持在持续流式输出音频的同时做后台异步推理和非阻塞工具调用。 集成时需按新协议处理:turnComplete=true 不再代表模型空闲,客户端要监听后续消息;用 interaction_status(IN_PROGRESS/IDLE)判断服务状态;函数调用仅支持 NON_BLOCKING 异步模式;thinking_config 的 thinking_level 支持 low/medium/high(不支持 MINIMAL);proactive_audio 永久开启。 最新更新于 2026 年 9 月。
评论点赞收藏14 天前

Gemini 智能体视频理解

Gemini 模型支持视频理解,提供文件上传、内联数据、YouTube URL 等多种输入方式,最大支持 20GB 文件。文档包含 Python、JavaScript、Java、bash 四种语言的代码示例,展示如何上传视频、轮询处理状态、调用 interactions API 生成摘要和测验。
评论点赞收藏28 天前

Gemini 3.7 Flash 模型规格说明

Google 发布 Gemini 3.7 Flash 模型,支持 100 万输入 token 和 6.5 万输出 token,具备多模态输入(文本、图片、视频、音频、PDF)和代码执行、计算机使用、文件搜索等功能。
评论点赞收藏47 天前

Gemini 3.6 Flash 与 3.5 Flash-Lite 正式发布:弃用采样参数与 API 变更指南

Google Gemini 3.6 Flash 和 3.5 Flash-Lite 正式 GA。3.6 Flash 侧重复杂多模态与 Agent 任务,成本降低;3.5 Flash-Lite 主打高吞吐文档解析。 关键变动:temperature、top_p、top_k 参数被弃用并忽略,未来将报错;不再支持预填充模型回复(prefilled model turns)。需改用 system_instruction 控制输出格式,并迁移至 Interactions API。
评论点赞收藏70 天前

Gemini 3.6 Flash:面向 Agentic 时代的高性能多模态模型

Google 发布 Gemini 3.6 Flash 模型,主打在保持前沿智能水平的同时提升速度与降低成本。该模型针对 Agentic 场景优化,擅长代码生成、代理执行及空间推理,支持百万级输入 Token 与 65k 输出。 功能上涵盖缓存、代码执行、结构化输出及搜索 grounding 等,但不支持音频/图像生成及 Live API。
评论点赞收藏71 天前

Gemini Interactions API 概览

Google 宣布 Gemini Interactions API 于 2026 年 6 月正式全面可用,作为构建 Gemini 模型和智能体的标准接口。该 API 统一了单轮生成、多模态理解及 Agent 工作流,支持服务端对话状态管理以降低 Token 成本,并提供后台执行功能。 目前支持 Gemini 3.x/2.5 系列及 Deep Research 等智能体。旧版 generateContent API 仍受支持但被视为遗留接口。
评论点赞收藏85 天前

使用 Gemini Omni Flash 生成和编辑视频

Google 发布 Gemini Omni Flash 预览版,支持原生多模态视频生成与编辑。核心特性包括:文本/图片生成视频、基于参考图的主体保持、以及通过 Interactions API 实现的对话式迭代编辑(Stateful video editing)。 该模型强调物理世界知识与叙事能力结合,提供 REST/SDK 代码示例及提示词指南。
评论点赞收藏90 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。