要点速览
- Google 在 Gemini at Work 活动发布面向工作的单一通用 Agent Gemini,强调统一记忆、多 Agent 编排与跨模型调度。
- Demis Hassabis 与 James Manyika 撰文提出 AI 作为“发明方法的发明”,并抛出科学自动化后的认识论与经济学问题。
- Google DeepMind 发布 de novo 酶设计流水线 AlphaProtein Novo,在 2 个基准反应上取得 SoTA“novel-scaffold”活性。
- SpaceX 收购全美 800 MHz 低频段频谱牌照,FCC 同时批准 Starlink Mobile Gen2 星座,马斯克称这是全美完整手机覆盖的“最后一块关键频谱拼图”。
- OpenAI 披露截至 9 月底年化收入 500 亿美元,高于 7 月的 300 亿美元,但低于此前报道的 700 亿美元。
- OpenAI 上线 Ultrafast,适用于 API、Codex 和 ChatGPT Work 中的 GPT-6.1 Sol,速度最高可达 Sol Standard 的 8 倍。
- Anthropic 与 Claude Science 合作绘制首张完整紫外天空图,并启动 Anthropic Cyber Mission。
一、AI 模型与基础设施
- Google 在 Gemini at Work 活动发布 Gemini,定位为面向工作的单一通用 Agent,具备业务上下文,可从单一提示框完成知识工作、问答、内容创作到编码。其架构原则包括统一 Agent、基于 Web 且可跨设备并集成第三方应用、可在无专用 UI 下运行、云端持久执行并保持单一记忆/上下文/个性化图谱、多 Agent 编排、了解工具数据与工作历史并随使用学习、跨多模型编排以兼顾质量与降低成本。1
- OpenAI 宣布 Ultrafast 当日上线,适用于 API、Codex 和 ChatGPT Work 中的 GPT-6.1 Sol,速度最高可达 Sol Standard 的 8 倍,并称其具备接近 Astra 的智能水平。1
- Meta 论文“Memory Mosaics at scale”提出用关联记忆网络替代标准注意力机制,据称仅用 1 万亿 token 训练的模型在表现上超过用 8 万亿 token 训练的传统 Transformer,并展现出更强的上下文学习和少样本解决新任务能力,可自动将复杂问题拆解为独立子任务。1
- Hugging Face 发布 TermGrade:面向终端智能体的开源 RL 环境,含 1000 个经执行验证的环境、按 6 个模型评分及 3.6 万条轨迹(含失败案例);用 gemma-4-31B-it 在其半数任务上训练后,Terminal-Bench 2.1 提升 3.1 分。其环境、全部轨迹(含 1.4 万条失败)、训练切分和检查点均已开放。1 2
- Midjourney 正在 Alpha 网站测试图像生成的“thinking mode”,称其可提升提示词准确性、文字排版和画面连贯性,并邀请用户试用反馈。1
二、AI 与科学发现
- Demis Hassabis 与 James Manyika 为 Google DeepMind Institute 撰写 AI x Science 文章《Bending the Curve of Discovery》,认为 AI 的真正前景是成为 Griliches 意义上的“发明方法的发明”(IMI),如显微镜或统计推断,从而解锁此前人类无法触及的问题和发现模式。文章指出,当前 LLM 与 AlphaFold 等专用模型是经济互补关系:LLM 负责分析、编码和写作,专用工具负责领域预测,多数交接由科学家完成;未来可能由 LLM 自动编排这些交接,提示专用模型、审计输出并循环,直到问题解决或到达湿实验室测试等非自动化阶段,科学家角色转向设计该循环。作者称 Anthropic 此前的酶发现及自身工作已显露这一流程雏形。1
- 文章提出若干认识论问题:当发现由难以解释的黑箱模型做出时,科学理解将是什么样;科学自动化后如何提取机制而非仅输出、理论将是什么样;若 AI 自动化写作和初级实验室工作,如何培养下一代科学家;以及在这一认识论现实中科学家的动力是什么。文章还提出经济学角度:假设生成变便宜后,瓶颈下移至验证和选择值得问的问题;实现 AI 全部潜力需要基础设施投资和机构改革,因此这既是技术挑战也是组织挑战。作者称尚无答案,希望听取他人意见。1
- Demis Hassabis 发布 AlphaProtein Novo,一个 de novo 酶设计流水线,与 Frances Arnold 团队合作开发 AP Novo,在 2 个基准反应上取得 SoTA“novel-scaffold”活性,并创造出用于合成药物基序哌啶和降解环境毒素 DEHP 的酶。1
- Anthropic 与 Claude Science 合作绘制出首张完整紫外天空图;此前天文学家已从射电到伽马射线完成全天图,但大片天区从未在紫外波段被观测。研究者 Brice Ménard 称,他引导 Claude 查找现有数据集、进行合并,并用统计推断填补空白;这项工作原本需人类数周,借助 Claude 仅用几天,期间他还能处理其他项目。该紫外天图被视为有用的教学工具,也被 Anthropic 作为 AI 使科学家长期搁置的低优先级、慢节奏工作变得可行的例证。1
- Hugging Face 转发内容指出,随着算力驱动的自主智能体让科学发现趋于商品化,公开分享知识的激励正在瓦解:发现声望下降、低质量论文泛滥、企业更倾向保密以内部迭代;其目标是通过工具维持开放共享,例如用 ML Intern 让智能体独立复现论文实验。1
三、商业与基础设施
- SpaceX 宣布收购覆盖全美 800 MHz 低频段频谱牌照(最多 14 MHz 配对频谱),用于 Starlink Mobile 成为美国主要移动运营商;低频信号穿透力强、改善室内覆盖,且多数美国手机已支持该频段。FCC 同时批准 Starlink Mobile Gen2 星座,授权发射 1.5 万颗针对 2 GHz 优化的卫星,V2 卫星带宽超当前代 100 倍以上,并授权 Ka/V/E/W 回传频段。马斯克称这是 SpaceX 提供全美完整手机覆盖所需的“最后一块关键频谱拼图”。1 2 3 4 5
- OpenAI 向投资者披露,截至 9 月底年化收入为 500 亿美元,高于 7 月的 300 亿美元,但低于此前报道的 700 亿美元;Anthropic 截至 7 月底年化收入为 650 亿美元。1
- Anthropic 宣布启动 Anthropic Cyber Mission,称其是一项保护关键基础设施和开源软件的新行动。1
- SpaceX 发射量从 2016 年的 8 次增至 2025 年的 170 次,超过其他所有国家总和。马斯克称 SpaceX 今年可能承担约 90% 的入轨质量,近 80% 在轨活跃卫星属于 SpaceX。1 2 3
- Starlink 推出推荐计划:推荐好友双方各得 100 美元,覆盖多数国家,奖励因市场而异。1
四、Agent 与工具生态
- Aravind Srinivas 称,Computer 为 OpenAI 数学手稿发布中的全部 722 篇预印本制作了解释视频,总时长 93 小时,视频发布在 YouTube。Perplexity 设计团队使用其自有 Agent 平台 Computer 构建了品牌形象更新背后的工具,相关访谈已发布。Computer 的新网站编辑器支持针对页面特定元素排队提交修改请求,提交后 Computer 在主线程中处理并输出新网站。1 2 3
- pplx-decider-v1.1-27b 在 Decision Bench 上准确率最高且成本最低:在 1071 个案例中达到 94.5% 准确率,每 1000 次决策成本 0.017 美元。1
- Grok Bot 获多方好评:有用户称其可在手机上完成 Colab 笔记本、网站页面、安全机器人等多项工作;有用户称用一句话即可将特朗普颁奖视频自动剪辑成竖版带字幕短片;有用户称零投入测试即自动完成视频剪辑、审查和配音。马斯克称 Grok Bot 只会越来越好,可组建整家由 Grok Bot 构成的公司。有用户称其已接入 Opus 5.5、速度更快、Bot 可完全访问 X。Grok Bot 可连接 Claude 和 ChatGPT 订阅,无需 API 密钥或新订阅;Shopify 已接入 Grok 和 Bot;Grok Imagine API 上线 Video 1.5 Lite,480p 每秒 0.02 美元、720p 每秒 0.03 美元、1080p 每秒 0.14 美元。1 2 3 4 5 6 7
- Rowan Cheung 称 GrokBot 近期更新加入原生 X 监控能力,并分享 4 个可复制粘贴的自动化例行任务:每工作日 9:15 搜索 X 与网络,筛选真实 AI 工作流,仅保留说明原任务、工具与结果(省时、减少步骤或替代人工交接)的案例,排除产品发布和“10 个提示词”类炒作帖,最多返回 3 条并发送到 Slack;每工作日 9:00 搜索过去 24 小时内提及指定品牌、账号或本人姓名的 X 帖子,标注作者、链接、一句话摘要及情绪类型,不回复,汇总发到 Slack 并 @ 本人;每 4 小时搜索正在评估某类产品的人,捕捉三类信息,附引用、链接和账号并分类,跳过超过 24 小时及自我推广账号,仅在出现未分享过的新内容时发 Slack,不互动;每工作日 8:30 读取通讯录中最近 14 天新增联系人,列出姓名、添加日期、电话、邮箱和备注,先询问谈话内容再在任务工具中生成带上下文的跟进任务,不主动发短信、邮件或打电话。被引用推文称 Grok Bot 现在可以搜索、读取和监控 X。1
- Ben Tossell 列举多款会议提醒/记录工具的实际触发方式:dot、grok bot、poke、instinct 提示会议开始,OpenAI meetings 插件、granola、dia 负责加入 Zoom 或记笔记,并称理论上不应再错过会议。其转发介绍一个开源实现,复刻 Cognition 的 dreaming memory 系统,构建于 Cloudflare Artifacts、Durable Objects、Alchemy 和 Effect 之上;转发者称这是 Agent 记忆较流行的做法之一,认为 Cognition 发布的详细规范“简单而优美”,并提到计划将相关研究心得用于 supermemory。1 2
五、行业观察与观点
- Ethan Mollick 认为 Google 在 Gemini 4 之后面临的挑战是如何用好模型:Anthropic 与 OpenAI 显示趋势是走向以编排型智能体处理多种任务的单一界面,而 Gemini 3 时代充斥面向多个市场的碎片化产品,无法适应下一步。1
- Ethan Mollick 引用针对旧版 GPT-4o 的随机试验称,AI 使用可提高考试成绩且一周后仍有较小增益;把 AI 当导师(“增强”)的学生增益保留,让 AI 代写(“自动化”)的学生增益消退,所有实验总体均为正向效果。1
- Ethan Mollick 称在急诊分诊场景中,已过时的 Gemini 2.5 Pro 与 Gemini 2.5 Flash(无法访问患者病历)给出的建议,被其他医生评为与医生质量相当,且未发现安全问题;并称此后模型已显著进步。1
- 李开复 称,与 CEO 们关于 AI 的对话已从技术问题转向组织问题:AI 将如何改变企业经济结构、工作与领导力会怎样变化、公司自身必须如何演进;这些对话促成了他的新书《AI Native: The Mandate to Transform Your Company》。1
- swyx 称,前沿 Agent 实验室中该岗位(被描述为当前最难招聘、每家 AI 初创都想要的复合型角色)的市场薪酬包在 500 万至 5000 万美元之间。1
- Hamel Husain 转发观点:分发稀缺时做受众有价值,随后所有公司持续发帖使注意力稀缺,注意力又被标题党和低质内容滥用后,可信度成为稀缺资源,而可信度没有捷径。1
六、争议/待证实
- 美国劳工部 已暂停受理 Wipro、Infosys、TCS、Cognizant、HCL、Capgemini 等印度 IT 公司以及 微软、Adobe 的新提交和待审 PERM 申请,这意味着其 H-1B 员工将受 6 年上限约束且无法延期,也失去绿卡路径。1
- Harvey LAB-AA v1.1 法律基准引入幻觉门控指标:Grok 4.7(xhigh) 以 9.4% 的幻觉门控全通过率居首,Muse Spark 1.3(max)8.9%、GPT-6 Astra(max)8.6% 紧随;若不设幻觉门控,Muse Spark 1.3 以 26.7% 领先但三分之二通过含重大幻觉。GPT-6 系列最扎实,Astra 平均每任务 0.03 次重大幻觉;Grok 4.7 每任务成本约 9.50 美元,低于 Claude Fable 5.1 的约 21.70 美元。1
- Ethan Mollick 注意到,围绕 OpenAI 发布一系列证明及其对数学学科意义的争议中,至少部分 OpenAI 证明已引发广泛协作者社区极快的迭代进展;被引用推文称 Rohan 的 PR 经验证并合并,在极难区间把 κ 从 2⁻¹⁸² 收紧到 2⁻¹⁵,较此前结果提升 50 万倍、较 OpenAI 原始结果提升 2¹⁶⁷ 倍,并称这是结合多位贡献者技术的社区成果。1
- 马斯克 称所有超级智能组织已联合同意将 AI/SI 安全测试移至达美航空航班上进行,因机上无法联网。1
