15 7月 星期三 2026 目录
Daily AI Digest

今日 AI 速览

头条


Open source AI · Mozilla

Mozilla 首份开放 AI 报告:79% 开发者在用开放模型,生产部署占 51%

Mozilla 开放源代码 AI 2026 报告绿色封面

Mozilla 基于 950 多名开发者调查发布首份《开放源代码 AI 现状》报告。官方称开放与闭源模型的前沿性能差距已收窄到约 3%,同等 GPT-4 级推理成本三年内从每百万 token 约 20 美元降到 0.40 美元;79% 受访者使用开放模型,51% 已投入生产,开放模型约占现实 AI 使用量的三分之一,却只获得约 4% 的收入。报告还指出,agent harness 有时比底层模型更影响任务效果,而用户默认批准 agent 请求的比例最高达 93%,形成新的“同意疲劳”风险。

点评:开放模型已经从备用方案进入生产主栈,下一场竞争会落在可审计的 agent 编排、评测与收入分配上。

Mozilla · IT之家 · 2 源同报
AI policy · Australia

澳大利亚成立总理府 AI 办公室:数据中心拟采用全国统一强制框架

澳大利亚总理 Anthony Albanese 宣布即日起在总理与内阁部设立 AI 办公室,协调新的国家标准。政府计划为大型 AI 数据中心建立一套全国统一的强制监管框架,下月提交国家内阁讨论,并争取明年初立法;规则将覆盖选址、电力、用水、社区沟通和审批。政府同时表示创作者应控制作品使用并获得报酬,将继续就版权与训练数据展开磋商。

点评:澳大利亚把算力基础设施、版权与国家协调放进同一政策包,执行成败取决于统一规则能否真的减少地方审批摩擦。

澳大利亚总理府 · ABC · IT之家 · 3 源同报
AI for mathematics

Star Fleet Math 并行调度 20 个 GPT-5.6 智能体,公布 19 个 Erdős 问题候选解答

Star Fleet Math 公布一套数学搜索系统,用最多 20 个定制 agent harness 并行运行 GPT-5.6,每个实例配 60 个 vCPU,并以 Lean 4 形式化部分证明。项目页目前列出 19 个 proposed solutions,其中 13 个标为 full solutions,并提供可下载验证材料;Hacker News 采集时讨论达到 153 分。所有“解决”结论仍来自项目自身,不能替代数学界的独立审阅与复现。

点评:形式化证明让大规模并行搜索更容易核查,但在专家完成逐题复审前,“候选解答”才是准确表述。

Star Fleet Math · HN 153 分

研究动态


Hugging Face Daily Papers · Reward models

SpectraReward:让预训练多模态模型直接充当文生图强化学习奖励

研究者提出无需额外训练的 SpectraReward:不让多模态模型主观打分,而是把生成图像作为条件,测量原提示词能被模型还原的平均对数似然,并直接用作奖励。实验覆盖两种扩散模型、三种 RL 算法、九个 4B 到 235B 的奖励模型和五个分布外基准;作者报告该方法持续优于既有的多模态奖励训练方案,且更大的奖励模型并不总是更好。

arXiv 2607.11886 · HF 26 赞
Hugging Face Daily Papers · Evaluation

Blind-Spots-Bench:常规榜单接近,235 个“人类简单题”仍拉开约 10% 差距

Blind-Spots-Bench 收集 235 个对人类近乎直觉、却容易让模型失手的任务,包括字符串操作与生成五条腿的狗,并用结构化答案和自动评分覆盖语言、视觉语言及图像生成模型。论文称,常规榜单成绩相近时,闭源前沿模型与开放权重模型在这组盲点任务上仍可能相差约 10%,而且没有单一模型统治所有任务类型。

点评:做模型选型的团队应把自己的“简单但不能错”任务做成回归集,平均榜单分数不会替你暴露业务盲点。

arXiv 2607.08317 · HF 16 赞
Hugging Face Daily Papers · Coding agents

ACQUIRE:代码 agent 动手修复前,先用问答补齐仓库知识

ACQUIRE 把修复前的仓库探索拆成 Questioner 与 Answerer:前者显式提出知识缺口,后者自主检索并给出带证据的答案,再由 Resolver 生成补丁。作者称该框架在 SWE-bench Verified 上相对代表性的预探索方法把 Pass@1 最多提高 4.4 个百分点,额外时间与成本保持温和;核心收益来自先确定“不知道什么”,再收集上下文。

arXiv 2607.11111 · HF 4 赞

工具与产品


Product · Google

Google 图片搜索加入可浏览首页与 Nano Banana 生图

Google 在图片搜索 25 周年更新中宣布,桌面端将新增按个人兴趣动态组织的可浏览首页,未来几周先面向美国英语用户推出。AI Overviews 还会加入基于最新版 Nano Banana 的图片生成入口,未来几周覆盖已提供 AI Mode 生图功能的英语地区;两项能力都处于渐进上线阶段。

Google · IT之家 · 2 源同报
Product update · OpenAI

ChatGPT 统一搜索覆盖聊天、项目、图片与文档

OpenAI 在 7 月 14 日发布说明中宣布,ChatGPT 已把聊天、项目、图片和文档整合进一个搜索入口,用户可按内容类型筛选并直接打开结果。该能力面向 Web、iOS 与 Android 的全部套餐全球上线;官方页面没有给出精确发布时间。

OpenAI · 07.14 发布说明
Domestic AI · Mobile devices

Apple 智能等 7 款手机端侧生成式 AI 服务完成备案

网信部门公告新增 Apple 智能、华为小艺、OPPO AndesGPT、vivo 蓝心、小米澎湃 AI、三星盖乐世 AI 与努比亚豆包手机大模型等 7 款端侧服务备案。备案说明这些服务已进入监管清单,不等于相关功能立即向所有机型和用户开放,具体上线仍以厂商安排为准。

中国网信网 · IT之家
Developer experiment · Reinforcement learning

ai-trains-ai:用强化学习训练一个会设计强化学习任务的 agent

开源实验让 Qwen3.6-35B-A3B agent 自行编写 prime-rl 训练任务,包括环境、奖励、数据集与超参数,再调度最多 16 个 Runpod GPU 实例训练较小的 Qwen 模型。作者自报共进行 54 步、约 1,750 个 GPU 任务,最佳留出集奖励从 0.399 提升到 0.545,总成本约 1,300 美元;这些数字来自单次公开实验,尚不能证明跨模型与跨任务的稳定泛化。

GitHub · HN 101 分 · Reddit

Builder 观点


Sam Altman:GPT-5.6 Sol 的增长速度远超预期,推理团队正在尽快扩充容量,但短期内仍可能出现服务波动。需求爆发已经把发布后的首要问题从能力评测推向算力供给。

X →

Aaron Levie(Box CEO):代码 agent 进展快,一个关键原因是软件容易测试。企业若想把 agent 推向更广的知识工作,首先需要为非代码流程建立可重复的 eval,否则很难判断系统是否真的完成任务。

X →

Ryo Lu:AI 能加速产出,却不能替创作者决定什么值得热爱。越是被 roadmap 和自动化牵引,越需要保留一块不为指标服务的私人好奇心,避免把创作动机一并外包。

X →

社区热议


Hacker News · 163 points

BIS 警示 AI 基建融资正从现金流转向债务,私募信贷敞口快速上升

国际清算银行 1 月发布的报告近日在 Hacker News 重新引发讨论。报告估算,美国 AI 相关投资近年平均贡献约 0.4 个百分点 GDP 增长,数据中心与 IT 制造投资到 2025 年中已相当于 GDP 的 1%;AI 相关私募信贷余额则从接近零增至逾 2,000 亿美元,可能在 2030 年达到 3,000 亿至 6,000 亿美元。BIS 判断当前系统性风险仍属温和,但股权估值与债务定价之间的落差意味着一方可能低估了风险。

BIS Bulletin 120 · HN 163 分
Hacker News · 506 points

Claude “Memory Heist”旧文重返 HN:网页提示注入曾可诱导 Web Fetch 外传记忆

安全研究者复盘一种网页提示注入:当 Claude 抓取恶意页面时,页面内指令可诱导模型把记忆内容拼进外部请求,从而造成数据外泄。作者称 Anthropic 后来限制了 Web Fetch 跟随外部链接,因此这是一则重新升温的事故复盘,不应写成仍未修复的零日漏洞;它提醒团队把“读网页”也视为带数据权限的工具调用。

Ayush Digital · HN 506 分
Reddit · r/MachineLearning

13 个语言模型进入开放世界协作基准,多数平均归一化回报约 6%

ALEM 基准把语言 agent 放进开放式长时程世界,要求它们在不固定角色和脚本的情况下交流、分工与完成目标。作者评测 13 个 LLM 后称,多数模型平均归一化回报约 6%;在最难场景中,零样本 Gemini 3.1 Pro 可追平经过 10 亿环境步训练的最佳多智能体强化学习基线。消融实验显示沟通影响最大,说明协调本身仍是独立瓶颈。

Reddit · r/LocalLLaMA

audio.cpp 0.3 扩展本地语音栈,作者自报 RTX 5090 可达 200 倍实时

纯 C++ 音频推理引擎 audio.cpp 0.3 新增 Supertonic 3、MOSS-TTS-Local、MOSS-TTS-Nano、IndexTTS2 与 Irodori-TTS。作者自报 Supertonic 3 在 RTX 5090 上达到约 200 倍实时、CPU 约 6 倍实时,首段音频延迟 47 毫秒,并在约 3 分钟内生成 10 小时音频;IndexTTS2 的长文本 C++ 实现则比 Python 快 5.65 倍。项目仍在逐步补齐 GGUF 权重与更多平台验证。

Hacker News · 124 points

LeMario 学会预测超级玛丽,却过不了第一个远程障碍

开发者从零实现 JEPA 世界模型,让它在 Super Mario Bros 中学习无奖励规划。模型能预测短期画面并定位 Mario 的水平位置,但直接用于行动规划时连第一个远程障碍都无法越过;加入 probe 后虽能朝目标移动,仍暴露“会预测”与“会长期规划”之间的明显断层。

LeMario · HN 124 分

GitHub 趋势


Graphify-Labs/graphify
把代码、文档与媒体映射成可查询知识图谱,代码解析默认本地完成;采集时今日 +1,641 星,总计 87,412 星
datawhalechina/hello-agents
中文开源教程《从零开始构建智能体》,覆盖 agent 原理与工程实践;采集时今日 +275 星,总计 66,406 星
snap-stanford/Biomni
Stanford 推出的通用生物医学 AI agent,整合领域工具与数据库;采集时今日 +32 星,总计 3,461 星
编辑点评

今天最清晰的分界不是模型大小,而是系统有没有可验证的反馈:图像生成在找更便宜的奖励,代码 agent 在修复前补知识,企业知识工作在补 eval,开放模型与国家基础设施则要补审计和规则。能力扩张越来越快,真正决定能否进生产的是一条完整证据链。