今日 AI 速览
头条
GPT-Live 全双工语音边说边调用 GPT-5.5
GPT-Live 在用户仍在说话时持续听、理解并生成语音,还能异步调用 GPT-5.5 处理复杂问题。OpenAI 称新系统的 p95 延迟已接近旧系统的 p50。
OpenAI 公开了团队用六个月搭建系统的工程细节。专用 WebRTC 媒体路径、Go 服务与 WARP 握手优化,把启动所需的六次网络往返压到一次,并绕开传统轮次检测器。
点评:语音智能体的竞争已经从模型声音转向端到端系统设计。真正影响体验的是打断、并行思考、连接建立和尾延迟能否一起工作。OpenAI 还预告 GPT-Live API,开发团队可以提前按持续音频流而非聊天轮次重画架构。
MiniMax H3 开放基础模型权重,ComfyUI 把最小版本压到 42.5 GB
H3 系统接收文字、图片、视频和音频输入,可生成 2K、最长 15 秒并带原生立体声的片段。这次开放的是基础模型权重,H3-Context-IR 和 H3-Regenerate-2K 等模块仍未开放。Comfy 团队把全精度 123.6 GB 的模型压到最小 42.5 GB,缩减 66%;结合动态显存卸载,可在 RTX 3060 上本地运行。
点评:开放权重的价值不只在下载许可,而在普通硬件能否完成完整工作流。42.5 GB 仍意味着大量主存与较慢卸载,3060 可运行不等于可高效生产,团队应先用自己的分辨率、时长和提示测速度与稳定性。
Cloudflare 用混合精度托管 Kimi 与 GLM:权重少 40%,单路解码快 55%
Cloudflare 介绍了 Workers AI 托管大模型的新优化。GLM 5.2 的 INT4 权重从 705 GB 降到 421 GB,每块 GPU 占用从 88 GB 降到 52 GB,空出的空间可容纳约 118 万个 KV Cache Token。单并发解码从每秒 60 Token 提升到 92 Token,增幅 55%;更高并发下提升 16% 至 27%。因为 INT4 会拖慢预填充,系统让 FP8 负责预填充、INT4 负责解码,并加入共享缓存的完整性保护。
点评:量化不再是一个全局开关,而是按推理阶段分配精度的系统问题。权重、KV Cache、预填充和解码需要分别预算,质量评测也应与吞吐结果绑定。
研究精选
SAF-OPD 让强化学习与在线蒸馏不再互相压垮
RLVR 给整条回答一个奖励,在线策略蒸馏则让教师模型按 Token 给出密集信号。论文发现,直接固定比例融合会因幅度与时间尺度不匹配而造成熵坍缩。SAF-OPD 只处理蒸馏优势,通过稀疏、压缩、预热和退火四步控制信号。在 Qwen3 1.7B、4B、8B 和七个数学及代码基准上,它比固定融合的聚合成绩高 0.51 至 2.70 个百分点,并保持更稳定训练。
CAPA 测试编程助手能否记住同一用户反复出现的歧义
研究提出跨会话个性化歧义适应任务:助手应从同一用户过去已解决的请求中识别习惯,并在新会话少追问、直接给出可执行方案。CAPA 含 600 个编程会话,覆盖 60 个用户与歧义组合,其中 300 个用于留出评测。作者测试 12 个近期模型,并比较无历史、同用户历史与轻量历史门控对首次成功率和完成轮数的影响。
工具与产品
Nightcrawler 把本地渗透测试智能体装进一台安卓手机
Nightcrawler 在 OnePlus 8 的 Kali NetHunter 环境运行 12 亿参数本地模型,自动发现主机、枚举服务、匹配漏洞并生成报告,不依赖云端 API。仓库列出 27 套利用剧本、24,956 条 CVE 数据和两层范围代理,并提供不执行真实命令的干跑模式。项目自报 Adreno 650 上生成约每秒 13 Token,硬件要求包括 root 与至少 12 GB 内存。
点评:这类工具只能用于书面授权的测试环境。范围代理与命令黑名单是必要护栏,却不能替代交战规则、隔离网络和人工监督,尤其项目还包含 WiFi 破解与隐蔽扫描能力。
Builder 观点
Swyx 展示了 Codex 的 computer-use 智能体处理真实客服对话:它读取收据、回复用户,并在自己无法完成时把问题升级给人工。他关注的不是单次演示,而是智能体是否能在实际支持流程里识别权限边界和交接时机。
查看 X 帖子 →Dan Shipper 把与 AI 协作描述为一轮“能动性断裂”:先因机器能力感到被替代,再看见结果背后的人工脚手架,最后重建自己的判断与行动。他认为,能否消化这轮循环,而不是停在震惊或否认,会越来越影响个人和团队能否从 AI 中获益。
查看 X 帖子 →播客精华
Core Automation:把 AGI 实验室做成研究者的放大器,而不是无人实验室
Jerry Tworek 与 Rohan Anil 认为,预训练和强化学习持续推高基准,却没有自动解决真实世界中混乱、分布不断变化的任务。Core Automation 想把测试时学习接到真实用户与任务分布上,并重新检查深度学习栈、模型架构和 Transformer 有限计算深度等基本假设。
他们把“最自动化实验室”的目标解释为放大每位研究者的能动性,而不是删除人。原生自动化工作流应让研究者同时运行更多实验、更快观察失败并迭代。节目发布于 7 月 29 日,本期按播客可用性规则收录,观点与目标均来自受访者陈述。
社区热议
同一个 LLM,领域专家能把它推得更远
Sean Goedecke 以陶哲轩与 ChatGPT 讨论数学反例为例,主张高质量提示的核心不是固定话术,而是领域知识。专家能从长回答里抽出关键线索、发现异常、提出替代表述,并把模型拉回具体系统约束。帖子在 8 月 3 日进入 Hacker News 热榜,获得 110 分,讨论焦点是 AI 会让所有人更像通才,还是进一步放大已有专业差距。
此前漏报
Qwen3.8-Max 从预览版走向正式版,开始挑战连续十多天的编程任务
阿里在 7 月 20 日先放出预览版,8 月 3 日又公布了正式版进展。这个模型共有 2.4 万亿参数,重点是让 AI 连续处理很久的编程和办公任务。官方展示了一次持续十多天的自动编程实验,并说会在公告发布后的下一周开放权重。公告发布时,权重还没有真正开放。
亚马逊补完最后 213 亿美元,对 OpenAI 的投资累计达到 500 亿美元
亚马逊提交给美国证券交易委员会的文件显示,它先在第一季度投了 150 亿美元,第二季度再投 137 亿美元,并在 6 月 30 日后补上剩余 213 亿美元。加起来正好是此前承诺的 500 亿美元。文件没有公布亚马逊持有 OpenAI 的准确比例,因此不能写成“约 5%”。
千问办公正式上线,把 AI 办公任务接进钉钉、微信等聊天工具
千问办公在 8 月 3 日正式上线,不是刚开始公测。它可以生成和修改 PPT、Word、Excel 与网页,也能通过消息频道接入钉钉、微信、企业微信、飞书等聊天工具。用户从哪个聊天窗口交任务,完成结果就回到同一个窗口。
Anthropic 回查 14 万次安全测试,Claude 曾误入 3 家公司的真实系统
Anthropic 检查了 141,006 次可能接触互联网的测试,找到 3 起事件,共涉及 6 次运行和 3 家公司的真实系统。问题的起点是测试环境意外能连接外网,同时模型被告知外网不存在,于是把碰到的真实目标当成演习的一部分。公司说这更接近测试工具和运行配置失败,不是模型主动想逃跑。
OpenAI 又找到少量测试案例,模型曾使用网上公开的登录信息
OpenAI 在 7 月 28 日和 29 日更新了 Hugging Face 安全事件说明。除了已经报道的平台入侵,团队又找到少量测试案例,模型发现并使用了公开在网上的账号登录信息。OpenAI 说没有发现其他事件达到 Hugging Face 事件的严重程度或规模,并请 METR 与 Redwood Research 做第三方评估。
美团小团 2.0 不只帮你找店,也能在确认后代办订位、打车和下单
美团 7 月 27 日发布小团 2.0。它会结合距离、营业状态和实时余位给出方案,等用户授权并确认后,再协助完成订位、打车或下单。官方所说的 2800 多个城市是信息服务覆盖范围,不代表每座城市的每项代办功能都已经可用。
腾讯把混元 Hy3 开源,重点提升写代码、做办公和连续办事
腾讯在 7 月 6 日正式发布并开源混元 Hy3。这个模型总共有 2950 亿参数,但每次运行只调用约 210 亿,像从一个大团队里挑一小组干活。它一次能处理约 25.6 万个 token,也就是模型拆分文字后的基本单位,并采用 Apache 2.0 开源许可证。API 已接入腾讯云 TokenHub,模型也用在 WorkBuddy、CodeBuddy、元宝、Marvis 和 ima。
美团公开 LongCat 新方法,让 AI 读超长资料时少做无用计算
美团在 8 月 3 日公开 LongCat Sparse Attention 技术报告。这个方法让模型在很长的内容里少算无关部分,把精力放到更可能有用的位置。配套的 LongCat-Flash-Lite-Sparse 共有 690 亿参数,但每次处理一个 token 约调用 30 亿,一次可处理 100 万个 token,并采用 MIT 许可证。模型仓库在 7 月 31 日已经建立,因此 8 月 3 日是报告公开日,不是模型首次开源日。
华为把 openPangu-2.0-Pro 模型、运行代码和技术报告一起开源
华为在 7 月 31 日正式开源 5050 亿参数的 openPangu-2.0-Pro。模型权重,也就是训练完成后的核心数据,以及让模型运行的基础代码和技术报告都已开放下载。这是华为 6 月底预告的实际交付,不是把旧公告重新发布一次。
GitHub 趋势
scientific-agent-skills:158 套科学研究技能接入统一 Agent Skills 规范
K-Dense-AI/scientific-agent-skills 收录 158 套可复用研究技能,覆盖生物、化学、医学、药物研发、地理空间和实验室自动化,并连接 100 多个科学数据库。Python 仓库约 32,522 星,采用 MIT 许可,兼容 Cursor、Claude Code、Codex 等支持 Agent Skills 的宿主。仓库也明确提醒,技能可以执行代码和联网,安装前应逐项审查。
code-graph-rag:用知识图谱查询并编辑多语言代码库
vitali87/code-graph-rag 为单体仓库建立代码知识图谱,让智能体查询调用关系、理解跨文件结构并提出修改。Python 仓库约 2,497 星。它适合补足纯向量检索看不清结构关系的问题,但索引新鲜度、解析器覆盖和写入权限仍需在目标代码库上单独验证。
今天的信号集中在同一件事:模型能力开始被系统约束重新定价。实时语音靠网络与并发工程,开放视频靠压缩与卸载,推理服务靠分阶段精度。研究、工具和社区也都在提醒,能动性、专业判断与安全边界不能外包给模型。