要点速览
- Google Gemini 4 Argon 在 Blueprint-Bench 2、AutomationBench-AA 等基准登顶,智能指数与 GPT-6 Astra 持平,但准确率与定价存在取舍。
- 研究显示前沿 AI 在中等长度会计任务上已快于并优于初级会计师,18 个月前还远低于人类水平。
- Perplexity 推出 Decisions API,输出固定答案集上的概率分布而非文本,并计划开源对应多模态决策模型。
- Hugging Face 生态密集更新:多 harness RL 让同一模型跨 harness 得分从 62% 降至 33% 的问题得到缓解,Diffusers 张量并行加载提速约 2.4 倍。
- SpaceX 完成 Crew-13、Transporter-18 与 NROL-97 多项发射,Google 与 Planet 将搭载四个 TPU 的原型卫星送入轨道。
- LeCun 转发观点认为 AI 投资需在 2032 年达到约 3.7 万亿美元年收入才能回本,而当前约 2000 亿美元。
一、AI 模型与基准
- Google 新模型 Gemini 4 Argon 在 Blueprint-Bench 2(AI 代理根据公寓室内照片绘制平面图)上排名第一,被称对物理 3D 世界的理解优于其他 AI。据转发信息,其在 Artificial Analysis 智能指数(高推理)得 53 分,与 GPT-6 Astra(max,53)持平,领先 GPT-6.1 Sol(max,52)1 分,比 Gemini 3.1 Pro Preview(30)高 23 分;幻觉率 15%,为智能指数 45 分以上模型中最低,但准确率 50%,低于 GPT-6 Astra(max,63%)。1 2
- 价格方面,Gemini 4 Argon 标准定价为每百万输入/输出 token 4/20 美元,当前五折至 2/10 美元,缓存输入折扣升至 95%;折后每项智能指数任务成本 1.99 美元,为 GPT-6 Astra(max)的 60%,但为 GPT-6.1 Sol(max)的 2.7 倍,折扣结束后将升至 3.98 美元。该模型正面向部分用户推送、尚未公开,折扣为初期促销,结束日期未确认。1
- 代理能力上,Gemini 4 Argon 在 AutomationBench-AA 以 77.5% 排名第一,领先 Claude Sonnet 5.5(max,71.3%)6 个百分点;Terminal Bench 4 得 57%,较 Gemini 3.1 Pro Preview 提升 53 个百分点,落后于 Claude Sonnet 5.5(max,64%)、Claude Opus 5.5(max,60%)和 GPT-6 Astra(59%)。模型支持 100 万 token 上下文,可输入文本、图像、视频和语音,输出文本。1
- 一项研究结论显示,在中等长度、定义明确的会计任务上,前沿 AI 模型已比初级会计师更快、更准确,甚至优于该研究中表现最好的初级会计师;而 18 个月前,这些模型的得分还远低于人类会计师。另有观点称,若任务可验证,AI 现已解决此类任务:18 个月前最佳模型低于会计师平均约 37% 的得分,如今模型可满分完成;Opus 5.5 几乎即时以 100% 准确率解决所有会计任务,而人类耗时更多且错误较多。1 2 3
二、AI 产品与基础设施
- Perplexity 推出 Decisions API,由多模态决策模型 pplx-decider-v1-27b 驱动,该模型输出固定答案集上的概率分布而非文本;定价为每百万输入 token 0.04 美元,基准测试得分 85.71%。作者表示将开源该多模态决策模型 pplx-decider-27b,Decisions API 输出 token 免费,并计划在未来数日进一步降价。1 2
- Hugging Face 生态密集更新:huggingface_hub v2.1.0 发布,新增 Jobs 的重试、重跑、重新调度与端口暴露功能,可追踪 ZeroGPU 配额,HfFileSystem 下载借助 hf_xet 最高提速 17 倍,并支持从已测试配方部署 Inference Endpoints。Diffusers 的张量并行加载大幅升级:在 Flux.2-Dev DiT、TP 度为 4(A10G)时,加载时间从 30.4 秒降至 12.5 秒,每 rank 峰值 CPU 内存从 64.1 GB 降至 6.8 GB,约快 2.4 倍、CPU 内存减少约 89%。1 2
- 多 harness RL 方面,作者称同一模型、相同权重在不同 agent harness 中得分可从 62% 降至 33%;@adithya_s_k 与 Hugging Face 团队发布多 harness RL 指南,做法是不改 harness,而是把请求指向代理,代理兼容编码 agent 使用的四种 API 格式,记录 vLLM 采样的确切 token id 与 logprobs 并据此训练,无需改动 Claude Code、Codex 或 OpenCode 的任何代码。结果:同时在 4 个 harness 上训练,@liquidai 的 LFM2.5-2.6B 从 42% 提升到 54%;因对更少步骤完成任务给予小幅奖励,工具调用减少 31%;仅在 OpenCode 上训练可将其从 34% 提升到 58%,但多 harness 模型在所有 harness 上均有改善。1
- NVIDIA 表示,CoreWeave 新服务使用 NVIDIA Dynamo 中的 ModelExpress 和 Router 加速强化学习后训练中的模型权重重载,在与 NVIDIA 及 You.com 合作对 Nemotron 3.5 Lightning 做后训练时,模型重载速度较其基线提升 15 倍,并减少停机时间。CoreWeave Forge 将 W&B、OpenPipeAI 的后训练和 marimo 笔记本与 CoreWeave 的训练、推理、沙箱和注册表统一到一个环境中,使生产环境标记的 trace 可转为训练数据集和评估门槛;该服务支持任意模型、框架或云,已有 MasterClass 和 Canva 使用,并提供免费、专业和企业版。1
三、航天与物理世界模型
- SpaceX 完成 Crew-13 载人发射并与国际空间站对接,同时 Falcon 9 执行 Transporter-18 任务将 130 个载荷送入轨道,Falcon Heavy 完成 NROL-97 发射(NRO 首次使用 Falcon Heavy),共 4 枚助推器着陆。1 2 3 4 5 6 7 8 9 10 11 12 13
- Google 与 Planet 合作,通过 SpaceX Transporter-18 拼车任务将一颗搭载 四个 TPU 的原型卫星送入轨道,这是 Project Suncatcher 的第一步,该项目旨在研究未来能否在太空托管可扩展的机器学习基础设施;未来数周将收集 TPU 在太空物理应力、辐射和极端温度下的在轨数据,用于改进后续设计。1
- Starlink 机上 Wi-Fi 进展:阿拉斯加航空集团已在超过 40% 机队完成安装,夏威夷航空长途机队及阿拉斯加航空区域机队全部完成;有推文称机上 Wi-Fi 将于 2027 年推出。1 2
四、行业观点与争议
- LeCun 转发引用 Stijn Van Nieuwerburgh 的研究:2025-2032 年 AI 投资年均约占 GDP 3.6%,按 10% 回报率,到 2032 年行业需年收入约 3.7 万亿美元才能回本,而当前约 2000 亿美元;作者认为该收入难以达到,理由包括扩散缓慢、开放权重模型竞争限制定价、AI 短期内无法自动化整个职业;若达到则资本份额与不平等激增,若无法盈利则可能崩盘。1
- Anthropic 分享哈佛物理学家 Matthew Schwartz 的 Science Blog 客座文章观点:AI 与科学之间存在类似物理中“阻抗失配”的问题——两个系统各自运作良好,但彼此匹配不佳;把大模型当作人类合作者来使用,目前并非激发其科学优势的最佳方式。为应对该失配,Schwartz 构建了一套用于定量科学精确计算的工具包;由于相似计算常出现在差异很大的科学领域,Claude 找到了与生态学、群体遗传学及其他十余个领域的联系,Schwartz 随后与各领域专家合作,将模型引导向有意思的问题。1
- 关于《白宫超级智能协议》,有观点认为其通过要求聘请第三方审计并向独立董事会委员会报告,比几乎任何可设想的监管行动更具近期实际意义;董事会成员负有信托义务,若忽视审计报告可能面临法院恶意认定及 D&O 保险拒赔,认为这对普通美国人有利,且优于可能造成前沿受监管寡头垄断的新监管机构。1
- 争议/待证实:LeCun 转发讨论 LeWM 按时间步应用 SIGReg 无法阻止时间坍缩,建议对 (N*T, D) 张量应用 SIGReg 以处理慢特征,并称已证明可解决该问题。1
