今日 AI 速览
头条
Mozilla 首份开放 AI 报告:79% 开发者在用开放模型,生产部署占 51%
Mozilla 基于 950 多名开发者调查发布首份《开放源代码 AI 现状》报告。官方称开放与闭源模型的前沿性能差距已收窄到约 3%,同等 GPT-4 级推理成本三年内从每百万 token 约 20 美元降到 0.40 美元;79% 受访者使用开放模型,51% 已投入生产,开放模型约占现实 AI 使用量的三分之一,却只获得约 4% 的收入。报告还指出,agent harness 有时比底层模型更影响任务效果,而用户默认批准 agent 请求的比例最高达 93%,形成新的“同意疲劳”风险。
点评:开放模型已经从备用方案进入生产主栈,下一场竞争会落在可审计的 agent 编排、评测与收入分配上。
澳大利亚成立总理府 AI 办公室:数据中心拟采用全国统一强制框架
澳大利亚总理 Anthony Albanese 宣布即日起在总理与内阁部设立 AI 办公室,协调新的国家标准。政府计划为大型 AI 数据中心建立一套全国统一的强制监管框架,下月提交国家内阁讨论,并争取明年初立法;规则将覆盖选址、电力、用水、社区沟通和审批。政府同时表示创作者应控制作品使用并获得报酬,将继续就版权与训练数据展开磋商。
点评:澳大利亚把算力基础设施、版权与国家协调放进同一政策包,执行成败取决于统一规则能否真的减少地方审批摩擦。
Star Fleet Math 并行调度 20 个 GPT-5.6 智能体,公布 19 个 Erdős 问题候选解答
Star Fleet Math 公布一套数学搜索系统,用最多 20 个定制 agent harness 并行运行 GPT-5.6,每个实例配 60 个 vCPU,并以 Lean 4 形式化部分证明。项目页目前列出 19 个 proposed solutions,其中 13 个标为 full solutions,并提供可下载验证材料;Hacker News 采集时讨论达到 153 分。所有“解决”结论仍来自项目自身,不能替代数学界的独立审阅与复现。
点评:形式化证明让大规模并行搜索更容易核查,但在专家完成逐题复审前,“候选解答”才是准确表述。
研究动态
SpectraReward:让预训练多模态模型直接充当文生图强化学习奖励
研究者提出无需额外训练的 SpectraReward:不让多模态模型主观打分,而是把生成图像作为条件,测量原提示词能被模型还原的平均对数似然,并直接用作奖励。实验覆盖两种扩散模型、三种 RL 算法、九个 4B 到 235B 的奖励模型和五个分布外基准;作者报告该方法持续优于既有的多模态奖励训练方案,且更大的奖励模型并不总是更好。
Blind-Spots-Bench:常规榜单接近,235 个“人类简单题”仍拉开约 10% 差距
Blind-Spots-Bench 收集 235 个对人类近乎直觉、却容易让模型失手的任务,包括字符串操作与生成五条腿的狗,并用结构化答案和自动评分覆盖语言、视觉语言及图像生成模型。论文称,常规榜单成绩相近时,闭源前沿模型与开放权重模型在这组盲点任务上仍可能相差约 10%,而且没有单一模型统治所有任务类型。
点评:做模型选型的团队应把自己的“简单但不能错”任务做成回归集,平均榜单分数不会替你暴露业务盲点。
工具与产品
Google 图片搜索加入可浏览首页与 Nano Banana 生图
Google 在图片搜索 25 周年更新中宣布,桌面端将新增按个人兴趣动态组织的可浏览首页,未来几周先面向美国英语用户推出。AI Overviews 还会加入基于最新版 Nano Banana 的图片生成入口,未来几周覆盖已提供 AI Mode 生图功能的英语地区;两项能力都处于渐进上线阶段。
ChatGPT 统一搜索覆盖聊天、项目、图片与文档
OpenAI 在 7 月 14 日发布说明中宣布,ChatGPT 已把聊天、项目、图片和文档整合进一个搜索入口,用户可按内容类型筛选并直接打开结果。该能力面向 Web、iOS 与 Android 的全部套餐全球上线;官方页面没有给出精确发布时间。
Apple 智能等 7 款手机端侧生成式 AI 服务完成备案
网信部门公告新增 Apple 智能、华为小艺、OPPO AndesGPT、vivo 蓝心、小米澎湃 AI、三星盖乐世 AI 与努比亚豆包手机大模型等 7 款端侧服务备案。备案说明这些服务已进入监管清单,不等于相关功能立即向所有机型和用户开放,具体上线仍以厂商安排为准。
ai-trains-ai:用强化学习训练一个会设计强化学习任务的 agent
开源实验让 Qwen3.6-35B-A3B agent 自行编写 prime-rl 训练任务,包括环境、奖励、数据集与超参数,再调度最多 16 个 Runpod GPU 实例训练较小的 Qwen 模型。作者自报共进行 54 步、约 1,750 个 GPU 任务,最佳留出集奖励从 0.399 提升到 0.545,总成本约 1,300 美元;这些数字来自单次公开实验,尚不能证明跨模型与跨任务的稳定泛化。
Builder 观点
Sam Altman:GPT-5.6 Sol 的增长速度远超预期,推理团队正在尽快扩充容量,但短期内仍可能出现服务波动。需求爆发已经把发布后的首要问题从能力评测推向算力供给。
X →Aaron Levie(Box CEO):代码 agent 进展快,一个关键原因是软件容易测试。企业若想把 agent 推向更广的知识工作,首先需要为非代码流程建立可重复的 eval,否则很难判断系统是否真的完成任务。
X →Ryo Lu:AI 能加速产出,却不能替创作者决定什么值得热爱。越是被 roadmap 和自动化牵引,越需要保留一块不为指标服务的私人好奇心,避免把创作动机一并外包。
X →社区热议
BIS 警示 AI 基建融资正从现金流转向债务,私募信贷敞口快速上升
国际清算银行 1 月发布的报告近日在 Hacker News 重新引发讨论。报告估算,美国 AI 相关投资近年平均贡献约 0.4 个百分点 GDP 增长,数据中心与 IT 制造投资到 2025 年中已相当于 GDP 的 1%;AI 相关私募信贷余额则从接近零增至逾 2,000 亿美元,可能在 2030 年达到 3,000 亿至 6,000 亿美元。BIS 判断当前系统性风险仍属温和,但股权估值与债务定价之间的落差意味着一方可能低估了风险。
Claude “Memory Heist”旧文重返 HN:网页提示注入曾可诱导 Web Fetch 外传记忆
安全研究者复盘一种网页提示注入:当 Claude 抓取恶意页面时,页面内指令可诱导模型把记忆内容拼进外部请求,从而造成数据外泄。作者称 Anthropic 后来限制了 Web Fetch 跟随外部链接,因此这是一则重新升温的事故复盘,不应写成仍未修复的零日漏洞;它提醒团队把“读网页”也视为带数据权限的工具调用。
13 个语言模型进入开放世界协作基准,多数平均归一化回报约 6%
ALEM 基准把语言 agent 放进开放式长时程世界,要求它们在不固定角色和脚本的情况下交流、分工与完成目标。作者评测 13 个 LLM 后称,多数模型平均归一化回报约 6%;在最难场景中,零样本 Gemini 3.1 Pro 可追平经过 10 亿环境步训练的最佳多智能体强化学习基线。消融实验显示沟通影响最大,说明协调本身仍是独立瓶颈。
audio.cpp 0.3 扩展本地语音栈,作者自报 RTX 5090 可达 200 倍实时
纯 C++ 音频推理引擎 audio.cpp 0.3 新增 Supertonic 3、MOSS-TTS-Local、MOSS-TTS-Nano、IndexTTS2 与 Irodori-TTS。作者自报 Supertonic 3 在 RTX 5090 上达到约 200 倍实时、CPU 约 6 倍实时,首段音频延迟 47 毫秒,并在约 3 分钟内生成 10 小时音频;IndexTTS2 的长文本 C++ 实现则比 Python 快 5.65 倍。项目仍在逐步补齐 GGUF 权重与更多平台验证。
GitHub 趋势
今天最清晰的分界不是模型大小,而是系统有没有可验证的反馈:图像生成在找更便宜的奖励,代码 agent 在修复前补知识,企业知识工作在补 eval,开放模型与国家基础设施则要补审计和规则。能力扩张越来越快,真正决定能否进生产的是一条完整证据链。