要点速览
- Google DeepMind 发布 Gemini 4 Argon,首次让 Gemini 登顶 Vals Index,得分 68.9%。
- Flow 完成 5000 万美元 B 轮融资,估值 7.5 亿美元,由 Valor 和 Atreides 联合领投。
- NVIDIA VSS Blueprint 3.3 新增 Build Vision AI 技能,官方称仅凭一条提示词即可在 30 分钟内构建并部署面向制造业产线的视觉 AI 智能体。
- Hugging Face 开源 200 多个机器学习操作的 WebGPU 内核,称其为全球最快,完全在浏览器本地运行。
- Perplexity 开源上下文嵌入模型,称在 turbopuffer 的 context-bench 上表现最佳。
- Runway 推出面向效果营销的自主引擎 Runway Ads,并披露自 7 月以来的内部使用数据。
- 白宫“超级智能协议”由跨行业领袖签署,确立开发该技术的公司对安全开发与部署负主要责任。
一、AI 模型与基础设施
- Google DeepMind 发布前沿模型 Gemini 4 Argon,称在多项关键能力上有大幅提升,并优先通过 Fairwind Program 向政府和可信网络防御方负责任地推出,随后再扩大可用范围。该模型首次让 Gemini 登顶 Vals Index,得分 68.9%;在 Text Arena 以 1525 分排名第 1、Code Arena: WebDev 以 1679 分排名第 8,混合成本为 $8/MToken,被称为 Pareto 前沿上最具成本效率的模型。其在 Coding、Hard Prompts、Instruction Following、Longer Query、Creative Writing 及所有评估职业领域均列第 1,英文、非英文、中文、俄文亦居首,比第 2 名 Claude Opus 4.6 (High) 高 20 分。在 Artificial Analysis 上,Gemini 4 Argon 幻觉率为 15%,低于 Grok 4.7 的 29%、GPT-6 Astra 的 45%、Opus 5.5 的 59% 和 Fable 5.1 的 69%;其正确回答率低于 Opus 5.5 的 66%(为 50%),但不知道时会明确表示不知道而非编造。Google 称 Gemini 4 Argon 智能体已在数据中心释放超过 300 TiB 内存,具备 100 万 token 输出上限,并已用于优化自身基础设施:分析性能数据、发现内存优化并应用变更后推广。这些智能体还参与 C/C++ 到 Rust 的迁移,已覆盖 80 万行以上内核代码,部署前经过大量审计和测试;在视频解码器上,智能体用安全 Rust 替换 3.2 万行 SIMD 代码,使现有 Rust 移植版提速 2.7 倍且视频输出保持一致。1 2 3 4 5
- NVIDIA 在 AI 基础设施方面推进多项工作。NVIDIA VSS Blueprint 3.3 新增 Build Vision AI 技能,官方称仅凭一条提示词即可在 30 分钟内构建并部署面向制造业产线的视觉 AI 智能体,具备告警、视频搜索和事件报告功能。NVIDIA 转发介绍 Cosmos 的定位:构建面向物理 AI 的世界基础模型。“世界基础模型”一词由黄仁勋提出,融合世界模型与基础模型两个概念;此处“世界模型”取广义,指捕捉完成任务所需世界知识(物体、环境、物理行为)的模型,而非沿用机器人学中的特定定义。NVIDIA 转发的观点称,不同任务需要不同的世界模型,但它们描述同一物理世界,因此可整合训练各专用模型的多样数据,构建跨任务学习的单一模型——世界基础模型即“世界模型的基础模型”,学习可适配多任务与环境的物理世界共享知识,帮助机器人和自主系统预判行动后果、评估可能未来并改进决策。英伟达提出 AI 基础设施的“可替代性”(fungible)概念,指同一平台能灵活运行不同工作负载:各类 AI、AI 的各个阶段,甚至非 AI 工作负载;其称该平台为最大化“生产力”而构建,部署多年后仍“耐用”,且对每种模型和工作负载都“可替代”。1 2 3 4
- Hugging Face 发布多项开源进展。Hugging Face 开源了 200 多个机器学习操作的 WebGPU 内核,称其为全球最快,针对硬件专门优化、完全在浏览器本地运行,并可通过 @huggingface/kernels 使用。Hugging Face 发布新的上下文嵌入模型训练方法,使每个文档片段在编码时能看到整篇文档;pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 未公开的 context-bench 上取得新的最优结果。Hugging Face 遥测显示 TRL 当前每月训练量达 100 万次,其目标为每周 100 万次,并称每次后训练都在推动 AI 生态去中心化。eidon_ai 结束运营并开源其数据:9TB 第一人称视角视频,含 1,274 小时家务视频、7 点 IMU 手臂追踪、来自 27 个家庭的 13,451 条记录,采用 CC-BY-4.0 许可,已发布在 Hugging Face。1 2 3 4
- Perplexity 开源其上下文嵌入模型,称在 turbopuffer 的 context-bench 上表现最佳;被引用内容称 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新推出的非公开 context-bench 上刷新 SOTA,其训练方式为编码文档每个片段时以整篇文档为上下文。有转发内容称,Perplexity 新模型在其内部上下文嵌入基准 context-bench 上登顶,文档 recall@10 较传统 SOTA 嵌入模型提升 50% 以上,并称维护多个内部基准是为引导客户获得更好的搜索相关性。有转发内容详述第三方基准迭代过程:该人士自 voyage-context-3 发布后开始使用并评测上下文嵌入模型,认为长文档场景需同时高排名答案片段与消歧上下文片段,从而让搜索代理只读文档相关部分;Perplexity 团队一周内即提供新模型供评测,双方数周内反复迭代,其基准至少返工 9 次,Perplexity 未通过特权访问基准而是持续改进模型直至明显领先。1 2 3
二、融资、产品与行业动态
- Flow 完成 5000 万美元 B 轮融资,估值 7.5 亿美元,由 Antonio Gracias(Valor)和 Gavin Baker(Atreides)联合领投,红杉资本、Roelof Botha(SpaceX、Block)等参投;该账号转发称 Flow 已成为 Anduril、Joby、Stoke Space、Rivian 等前沿硬件团队需求与验证的默认平台,通用汽车 PPU 及大众与 Rivian 合资公司 RV Tech 也在用其 AI 重塑核心开发流程。转发内容提出:机械工程师日常约 90% 的执行工作(CAD、Excel、仿真)属于数字体力劳动,AI 代理将接手这类杂活,人类转向发明、架构、权衡与判断,工程师角色变化或为 CAD 发明以来最深刻;未来一年 AI 将从整合工作转向实际执行工作。作者在引用中称 Flow 对硬件工程的作用如同 Git+GitHub 对软件工程,能对齐数千利益相关方、加速汽车到火箭等复杂不可逆高价值流程,并称自己是朋友优先、小额投资者其次。1 2
- Runway 推出面向效果营销的自主引擎 Runway Ads,并披露自 7 月以来的内部使用数据:广告投放量扩大 1000%、广告支出回报率翻倍、转化率提升 34% 且点击率持平、单订阅用户成本下降 41%,并新增 1 亿美元 ARR;目前向部分企业合作伙伴开放,未来数周将大范围推广。其首席产品官 Anthony Maggio 在 AI Summit 上登台介绍了该产品。Runway 发布开放权重世界动作模型 Praxis-1,将视频预训练能力用于机器人真实世界控制,定位为可跨任意形态与环境的策略模型,面向机器人开发者与研究者;正与 Noble Machines、Standard Bots、Ultra 等早期伙伴测试,并计划未来数月公开权重。其机器人业务负责人 Andy Chen 在峰会上阐述了 Runway 的机器人路线并以 Praxis-1 首映收尾。Runway CTO Kamil Sindi 在 AI Summit 介绍首个世界界面模型 Solaris,称其为随交互自我构建的新型操作系统,每一帧都根据用户意图实时生成;他描绘了所有软件皆由生成产生、无需一行代码的未来愿景。Runway 联合创始人兼联合 CEO Anastasis Germanidis 在旧金山 AI Summit 开幕主题演讲中称,通用世界模拟器将是我们这个时代最重要的技术发展。1 2 3 4 5 6
- Perplexity 开放 Computer 的邮件任务入口:无需 Perplexity 账号,将任务发送、转发或抄送至 [email protected] 即可,限时免费;每个邮件任务作为 Computer 中的常规会话运行,可在网页和移动端查看,并保留与应用内任务相同的审计记录。Perplexity 面向符合条件的美国 Amex Business 小企业卡会员推出 Amex 策划的即用技能库,预置工作流可处理现金流预测、营销活动生成等日常业务任务,用户只需在 Computer 中选择任务并补充业务信息,无需从零编写指令。作者称 Computer 内置的 Seedance 对营销和品牌团队相当出色;被引用内容称可用 Perplexity Computer 中的 Seedance 2.5 为小企业生成商业或品牌视频,示例广告的品牌视觉、产品样机和完整剪辑均在 Computer 内完成。Perplexity 正在 Computer 中推出内联图表、示意图和可视化,包括来自 TradingView 的上下文金融图表;被引用内容称 Computer 可直接在对话线程中生成交互式图表,金融数据使用 TradingView Lightweight Charts 绘制K线、成交量和移动平均线。1 2 3 4
三、AI 治理与安全
- 白宫“超级智能协议”由跨行业领袖签署,确立开发该技术的公司对安全开发与部署负主要责任、未达标须担责,并以内部管控、独立外部评估和董事会监督加以强化。该账号转发观点称,现有针对网络攻击、隐私侵犯、欺诈和产品责任的法律已适用于超级智能,协议进一步要求企业提高透明度与接受审计。Google DeepMind 推出 SynthID Bio 蛋白质水印方法,并成功合成既有功能又被水印标记的 AI 设计蛋白质,相关成果发表于 Nature;该账号称这是 AI 时代生物安全的关键一步,并将开源 SynthID Bio 工具供研究社区在此基础上继续开发。Broad Institute、University of Exeter 等机构的研究者已在使用 AlphaGenome Atlas 识别潜在致病 DNA 变异并解读其作用。1 2 3 4
- Yann LeCun 转发多条关于 AI 治理与安全的观点。该账号转发的观点认为“超级智能”并非可明确界定的临界点,技术会持续变强但受物理定律和信息限制,不可能全知全能,因此“某天出现超级智能会怎样”这一问题本身没有意义。该账号转发贝恩公司(Bain & Company)的估算:到 2031 年,AI 公司每年需找到至少 4.2 万亿美元新收入,以支付其数据中心建设开支。该账号转发一则说法:Hugging Face 遭攻击时曾向 Anthropic 与 OpenAI 的模型求助被拒,最终靠自托管的 GLM 5.2 协助防护;转发者借此称闭源实验室以“安全”为由拒绝协助,并称开源 AI 正持续追赶被高估、定价过高的“前沿”模型。该账号转发关于前沿实验室网络能力与遏制评估的观点:像 METR 这类评估机构应配备有经验的网络安全人员,否则无法彻底评估相关风险。该账号转发关于开放权重模型的论述,称鉴于 Anthropic 近期试图为反对开放权重造势,作者认为开放权重对 AI 安全一直有深度且不可替代的作用。该账号转发观点称不存在所谓“AI 安全之战”,实为“亲智能”与“反智能”之争,认为“安全”是被用来暂停、阻止或扼杀 AI 的伪装词,并称 AI 放大人类智能、使人更聪明有效,若主张智能应由少数公司或政府控制,则属新蒙昧主义或新封建主义。1 2 3 4 5 6 7
- Ethan Mollick 转发并认同 Daron 关于 AI 治理的论点:AI 将影响就业、生产力、不平等、科学、传播、社会秩序和政治等各方面,若其重要性如宣称般重大,民主社会应让民主机构决定方向,过度依赖技术官僚可能危险且适得其反;Daron 反驳了极化、公众理解不足、竞争约束、AI 领袖伦理可靠等支持技术官僚的理由,并追问如何让不在美欧中的近 60 亿人也参与 AI 讨论。作者认为各公司的客服人员即将被 Dots、Muses 等 AI 代理用语音或聊天方式大量“围攻”以争取更优交易,已有用户委托此类代理省钱并传播开来的案例,预计会越来越多。作者称竞争格局再次变为三方角逐,并转发 Gemini 4 Argon 发布信息:该新前沿模型即日起向网络防御者推出,后续将尽快扩大范围,介绍期定价为输入 2 美元、输出 10 美元。作者撰文谈其对 AI 进展最被低估的一点——AI 自我组织以完成任务的能力,以及这对 Muse、Dots 等代理意味着什么,并配音乐视频解释为何人们不断重新领悟“苦涩的教训”。1 2 3 4
