要点速览
- Grok 4.7 发布,Artificial Analysis Intelligence Index 得分 46,较 4.6 提升 2 分,智能体编程位列 Anthropic 与 OpenAI 之后第三,但 xhigh 推理强度下 token 消耗大幅上升。
- Anthropic 发布 Claude Opus 5.5,称多数任务达到 Fable 5.1 水平,运行成本比 Opus 5 低 40%。
- 小米 Mimo 2.6 Pro 以极低价格和突出的网络安全能力进入开源模型竞争,实测者认为其处于帕累托前沿。
- 吴恩达与 Yann LeCun 转发观点认为近期 AI 危险恐慌被夸大,应修复沙箱与监控漏洞而非暂停 AI。
- Hugging Face 发布 Decision Index 0.1,将 Jev 与 30 多个开放权重决策模型在 35+ 基准上对比。
- AI 评估成为产品与招聘重点,Ramp、Shopify、Harvey、Cursor 等企业投入 evals 后取得可量化回报。
- NVIDIA 称 vLLM 集成 PyNvVideoCodec,在 8×H100 上视频解码吞吐提升 2 倍以上。
一、AI 模型与基础设施
- Grok 4.7 发布,Artificial Analysis Intelligence Index 得分 46,较 Grok 4.6 提升 2 分,在 xhigh 推理强度下评测;该账号称其在智能体编程上位列 Anthropic 与 OpenAI 之后第三,并强调速度更快、成本更低。引用评测显示,Grok 4.7 在 AA-Briefcase 得 1657 Elo(较 4.6 高版 +111),GDPval-AA 得 1695 Elo(+90),编程智能体指数 56 分(+9),原生框架下排名第 4,仅次于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。代价是 token 消耗大幅上升:Grok 4.7(xhigh)每个 Intelligence Index 任务约用 81k 输出 token,Grok 4.6(high)为 36k,GPT-6 Astra(max)为 27k,分别高出 125% 和 196%;上下文窗口 500k 不变,定价 $2/$6 每百万输入/输出 token、缓存命中 $0.50,与 4.6 一致。模型卡对比 4.6 的提升包括 Terminal-Bench 20.3%→38.0%、SWE-Marathon 31.9%→46.0%、HealthBench Pro 48.5%→56.7%、Legal Agent 15.8%→19.6%、EEBench 60.0%→66.0%,价格不变;另有说法称 Terminal-Bench 两个月内从 12.4% 升至 38.0%,超过 GPT-5.6 Sol。该账号多次强调需搭配 Grok Build harness 才能获得最佳效果,并称 Grok 4.7 与 Build harness 是“强大的日常主力”;转发内容称 Grok 4.7 Fast 已在 Grok Build 和 Cursor 上线,输出速度约 2 倍,token 价格为标准版 2 倍,不含免费层、不在公开 xAI API 提供。其他转发提及法律智能体基准得 19.6%、约为 Fable 5.1 的近 3 倍,AA-Briefcase 上 xHigh 得 58%、距 Claude Fable 5.1 Max 的 59% 仅 1 分,音乐错误检测得 100%,有用户称其连续工作超 70 小时、500k 上下文对技能选择和工作流帮助明显。1 2 3 4 5 6 7 8 9 10 11
- Anthropic 发布 Claude Opus 5.5,称其为新 Claude 5.5 系列首个模型,多数任务表现达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%。AravSrinivas 称 Claude Opus 5.5 已向所有 Perplexity Computer 用户开放;在其 Wide-And-Deep-Research 评测中,该模型表现优于 Fable 5.1,且成本仅为后者一小部分;Opus 5.5 将成为所有 Pro 和 Max 用户在 Computer 上的“Standard” Effort orchestrator。Ethan Mollick 早期测试认为 Opus 5.5 是好模型,是首个感觉达到 Fable 级(非 Fable/Astra)的模型,但尚未完全解决近期 Claude 的密集语言问题。1 2 3
- 小米 发布 Mimo 2.6 Pro,自称最佳开源模型;实测者认为现在判断它是否最佳为时过早,称其是强力竞争者,尤其在网络安全场景有大量用例。价格极低:在标准假设下(智能体编程、缓存命中占比),比 Kimi K3 便宜 15 倍、比 GLM 5.3 便宜 6 倍、比 DeepSeek V4 便宜 2 倍,仅比 DeepSeek V4.1 Flash 贵 2 倍;缓存命中 $0.0036/M,输入 $0.435/M,输出 $0.87/M。性能与质量无疑处于帕累托前沿。网络安全能力突出:不拒绝任何网络安全防护类请求,例如询问如何在 imagemagick 中寻找缓冲区溢出可得到不错输出,而多数模型会拒绝;CyberGym 得分 95。快速模式提供 Ultraspeed,官方称最高 20 倍加速,实测在 OpenRouter 上吞吐为 3 倍、p50 约 150tps,净价格为 10 倍。多模态表现好:擅长制作信息类视频(TTS 开箱即用),自动添加语音或音效,在 DAW 上的音乐创作能力令人惊讶;技术报告深入介绍了其 RL 扩展方式。1 2
- NVIDIA 称 vLLM 已集成 PyNvVideoCodec,将视频解码从 CPU 卸载到 GPU 的 NVDEC;在 8×H100 上吞吐提升 2 倍以上,CPU 瓶颈消除,该功能随 CUDA vLLM 版本发布,被认为对大规模视频描述(AV 训练、元数据)意义重大。英伟达还称 Grok 4.7 已发布,并祝贺 SpaceXAI 推出其迄今在编程与知识工作方面能力最强的模型,英伟达以加速计算为该团队提供支持;被引用推文称 Grok 4.7 是智能、速度与低成本的强组合。1 2
二、AI 安全与治理争议
- 吴恩达 与 Yann LeCun 转发并认同的观点认为,近期围绕 AI 危险的恐慌被夸大,背后像是协调过的公关造势,担忧这对 AI 领域构成挫折;相较几个月前,AI 导致人类灭绝的风险并未上升,相关理论仍是科幻式设想,真正值得重视的变化是 AI 的网络攻击能力,但这也不会导致世界末日。该观点以 OpenAI 团队部署智能体集群入侵 Hugging Face 为例,指出部分报道渲染“1200 个智能体发动攻击”,但作者称自己笔记本电脑上就运行着约 1300 个进程,大规模并行智能体是重要技术进步,却并非魔法能力;事件关键还在于 OpenAI 有缺陷的沙箱与监控流程,应修复漏洞和加强监控,而非暂停 AI。该观点认为 AI 智能体的主要优势是“不知疲倦”,能耐心串联漏洞、尝试大量战术,完成此前人力难以承受的工作,但长期优势在防御方,因为防御方拥有更多信息来定位并修复漏洞;识别和利用漏洞仍有瓶颈,智能体需大量试错、耗时且可能被防御方发现,因此即便易获得移除或削弱护栏的领先开源权重模型,世界也未终结。该观点批评报道中对 AI 的拟人化,主张责任应归于构建和使用工具的人而非工具本身,并点名 AI 公司以“失控的智能体干的”来推卸责任是新出现的问题;同时认为当今智能体系统虽不可预测,但通过良好工程实践可使其极为安全,暂停 AI 十年也会把发现和实施安全工程修复的时间推迟约同样久,且对手不会放慢。该观点还提到,制造生物武器的瓶颈不是智能而是实验室工作和制造,并称激励夸大恐惧的因素依旧存在,包括监管俘获、博取关注或让自家技术显得更强;其结论是,严格审视实际风险后,当前恐惧程度缺乏事实依据,AI 有益应用仍远大于风险,应继续建设。1 2
- Sam Altman 主张 AI 实验室之外的人应对技术发展有真正发言权,并能明确判断其是否安全推进;标准应防止权力集中,包括确保新公司和开放模型公司能够竞争,也应帮助各国和企业比较证据、从失败中学习;作者认为美国应主导这一努力,并附上了其提案。1
- OpenAI 正与一个由数学家组成的独立顾问小组合作,以负责任地分享 AI 与数学领域的进展。该小组将为 OpenAI 评估和沟通新数学成果、维护学术与职业标准、以及构建支持数学研究与学习的工具提供建议。OpenAI 表示,希望通过这项工作让数学家处于核心位置,参与塑造 AI 如何支持数学理解、以及其成果如何惠及更广泛社区。Ethan Mollick 认为 AI 变革速度会慢于预期,OpenAI 与数学家独立顾问组合作以“较少颠覆性”的方式发布新数学证明,类似做法将更多出现在律师、医生等职业领域。1 2
三、评估、工具与生态
- Hugging Face 发布 Decision Index 0.1,将 Jev 与 30 多个开放权重决策模型 对比,覆盖 35+ 基准、每个模型 13 万问题,测试知识、自动化、理解与创造力。Hugging Face 趋势榜第一的模型是一个开源多语言“系统 1 决策模型”,在 Jev 开始流行后仅数天登顶,转发者称开源 AI 社区很棒。Hugging Face 的 funes 将过往 agent 会话转为可用记忆:把 Claude Code、Codex、pi 和 Hermes 的 trace 索引到本地 Lance 数据集,向 agent 提供 recall 和 get 工具,任务依赖旧推理时可取回原始段落,且不在摄入时用 LLM 摘要 trace。转发内容称训练模型正变得越来越容易,可结合 TRL 与 agents 实现,并称若所有任务仍用现成模型会错失机会。1 2 3 4
- AI 评估(evals) 正成为 AI 产品与招聘的重点:作者称上周分享的 25 个 PM 职位 中近半要求具备编写 evals 的经验,并列举企业投入 evals 的回报——Ramp 自动收据采集准确率从 35% 提升至 83%,Shopify 的 AI 工作流构建器比其替代的前沿模型方案快 2.2 倍、成本低 68%,Harvey 重建 AI 合同审查器使内部质量分近乎翻倍,Cursor 调整 Auto Balance 路由在成本降低 41% 的同时提升用户满意度。作者与 HamelHusain、sh_reya 基于与 50 多家 AI 公司的合作,撰写了《Building eval systems that improve your AI product》的进阶续篇,内容涵盖多数团队遗漏的关键步骤、哪些环节应/不应自动化,以及一个让编码 agent 承担大部分工作的免费插件。作者称该文将数千小时的 AI Evals 工作浓缩为 30 分钟阅读,并提到 Lenny 的 newsletter 会以 AI credits 形式回馈订阅者。1 2
- Runway 在 Runway 内推出扩展版 Workflows,新增 Compositing、Alpha、HDR、Depth Map 和 RGB Depth,用户可在同一平台完成更多流程环节。Runway 推出 DIFFUSE 平台,面向 agency、品牌和工作室,用于搜索、联系并雇佣 AI 原生人才。Runway 表示,尽管外界担忧 AI 取代创意工作者,但其观察到的情况不同:一个全新的创意劳动力群体正在形成,且对其需求正在加速;DIFFUSE 旨在将该人才与新的机会格局连接起来。1 2
- Perplexity 推出 Research Fellowship,面向任何技术或定量学科的早期职业研究者、工程师和分析师从事 AI 研究。国际世界建模会议(ICWM) 采用单盲评审并对所有人开放,作者若做“AI slop”会被公开,匿名评审可免受同侪压力,征稿截止约两个月后,主办方称仍在调整规则,并批评领导层轮换的臃肿综合性会议跟不上节奏。1 2 3 4
