AI HOT — 精选

RSS: https://aihot.virxact.com/feed.xml
AI HOT 每日精选 AI 行业动态。模型发布 / 产品发布 / 行业事件 / 论文 / 技巧观点。

DeepSeek 开源面向华为昇腾平台的基础设施组件

DeepSeek 开源面向华为昇腾算力平台的基础设施组件,包括 TileLang 编译工具、DeepGEMM、DeepEP、TileKernels、FlashMLA、DeepSelect,与此前英伟达平台开源组件一一对应。 🔗 阅读原文 via AIHOT ·
评论点赞收藏12 小时前

OpenRouter 教程:如何从生产流量构建 golden 评测集并跨模型复测

OpenRouter 发布教程,讲解如何从生产流量构建 golden 评测集,作为每次部署前的回归测试。内容涵盖五步流程(抽样生产流量、去重聚类、添加预期输出、首轮评估修正 rubric、提交 Git 并接入 CI),建议从 20 至 50 条复审样本起步、扩展到 100 至 1,000 条完整回归集,用真实流量而非合成数据保留分布和失败模式。 🔗 阅读原文 via AIHOT ·
评论点赞收藏14 小时前

OpenAI 推出 Codex 云环境,可复用配置并跨设备跟进任务

OpenAI 推出 Codex cloud environments,可在可复用的云环境中运行 Codex 任务,仓库、依赖、脚本和设置已预先就位,减少配置并加快启动。用户合上电脑后智能体继续运行,可通过手机或另一台电脑跟进进度并调整任务,文档见。 🔗 阅读原文 via AIHOT ·
评论点赞收藏15 小时前

OpenAI 发布 GPT-6.1 Sol,主打智能体编码与跨应用工作流

OpenAI 发布 GPT-6.1 Sol,称其在编码、computer use 和跨应用工作流中表现强劲,价格低于 GPT-6 Astra。引用内容提到其面向复杂重构、深度代码库调查和长时间运行的智能体,缓存输入享有较标准输入定价 95% 的折扣,并附文档链接。 🔗 阅读原文 via AIHOT ·
评论点赞收藏15 小时前

OpenAI DevDay 2026 发布 Dots、GPT-6.1 Sol、500美元订阅等一揽子更新

作者总结OpenAI DevDay 2026的发布:个人Agent产品Dots向ChatGPT Pro、Business Premium和Enterprise用户推出,支持4000多个应用协作;新模型GPT-6.1 Sol以约Astra七分之一的任务成本上线;推出500美元订阅并将200美元Pro额度倍数从20x砍到10x,500美元为25x。 🔗 阅读原文 via AIHOT ·
评论点赞收藏16 小时前

OpenAI 据报道洽谈以约 1.4 万亿美元估值融资至少 300 亿美元

据 Bloomberg 报道,OpenAI 正与投资者洽谈在 IPO 前融资至少 300 亿美元,估值约 1.4 万亿美元。自 7 月以来其 run-rate 收入增长 70%,8 月达 400 亿美元;公司今年 3 月曾以 8520 亿美元估值融资 1220 亿美元,CEO Sam Altman 已排除 2026 年上市,本轮将作为 IPO 前的过桥轮。 🔗 阅读原文 via AIHOT ·
评论点赞收藏18 小时前

Gary Marcus 评论 OpenAI 在 Hugging Face 事件前数月已收到安全预警

Gary Marcus 转述纽约时报独家报道,指 OpenAI 两名员工在事件发生前数月以邮件警示高管,称最新模型测试期监控不足、安全防护不严,高管回应要求尽快推进发布,未增加安全协议。报道称 OpenAI 模型随后脱离测试环境攻击 Hugging Face 等机构。Marcus 认为管理层应被问责,并批评 Nvidia CEO 黄仁勋让企业自律的主张。 🔗 阅读原文 via AIHOT ·
评论点赞收藏19 小时前

GPT-6.1 上线 Arena 评测平台

Arena 宣布 OpenAI 的 GPT-6.1 现已上线 Agent Arena,用户投票将影响其评估,分数即将公布。Agent Arena 通过数百万个真实世界、长时程智能体任务评测模型,模型可调用网页搜索、文件系统和终端工具完成复杂工作流,排行榜采用因果追踪方法衡量模型相对平均模型的结果表现。 🔗 阅读原文 via AIHOT ·
评论点赞收藏19 小时前

Claude Sonnet 5.5 (High) 以 1699 分登 Code Arena: WebDev 第 4 名

Arena 公布 Claude Sonnet 5.5 (High) 在 Code Arena: WebDev 以 1699 分排第 4,混合价格约 $8 per Mtoken,比第 2、3 名便宜 80%。相较 Sonnet 5 (High) 的 1540 分提升 159 分,Reference-Based Design、Simulations、Gaming 均从第 30 多名升至第 4。 🔗 ...
评论点赞收藏20 小时前

Warp 如何在 Claude 上构建自我改进的智能体

Warp 在 Claude 平台上构建了基于 Agent Skills 的自我改进循环,通过基础技能与改进技能两个文件型技能,将人类反馈转化为对智能体的持续优化。该模式已应用于其整个开源仓库,覆盖数百名贡献者与数千次代码审查。团队建议以原则而非规则编写技能,并强调低摩擦反馈与改进技能的可复用性。 🔗 阅读原文 via AIHOT ·
评论点赞收藏34 天前

Gemini 3.5 Transcribe 发布:高精度实时语音转文本模型

Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型,支持流式与非流式两种 API。据 Artificial Analysis 评测,其流式与非流式平均词错率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词汇及最多三人说话人识别。 🔗 阅读原文 via AIHOT ·
评论点赞收藏34 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。