要点速览
- d1 发布视觉能力,在六个真实应用中四个持平或胜出 GPT-6.1 Sol 与 Claude Opus 5.5,成本低 19 至 200 倍。
- Grok 4.7 在 VulcanBench Frontier v4 的 23 项行为重建任务中包揽前三,xHigh 通过 23/23。
- Perplexity Decider 在 8 个决策模型玩俄罗斯方块的基准测试中持续位居榜首。
- 智能体身份标识标准与检测规避成为未来五年关键技术问题。
- Airbnb 评论机制被指存在漏洞,房客可删除好评变相报复差评。
- 斯坦福教授 Karl Deisseroth 与孩子分享诺贝尔奖消息。
- 洛杉矶“豪宅税”被指阻碍 9,100 套住房建设,抹去 16,650 个建筑岗位。
一、AI 模型与基础设施
- d1 发布视觉能力:首个决策模型支持图像、文本或两者作为输入;在六个真实应用(从客服工单过滤到电路板检测)中对比 GPT-6.1 Sol 和 Claude Opus 5.5,d1 在其中四个上持平或胜出,成本比两者低 19 至 200 倍,且每个任务回答速度显著更快。支持是/否、选择或评分问题的概率输出,单次前向传播、不生成 token,文本决策耗时 200 至 300 毫秒。1
- Grok 4.7 处理大型代码仓库表现出色:在 VulcanBench Frontier v4 的 23 项行为重建任务中包揽前三,xHigh、High、Medium 分别通过 23/23、22/23、21/23,得分 93.15、92.71、92.30,超过 Fable 5.1、Opus 5.5、GPT-6 Astra、GPT-6.1 Sol 等模型。1
- Perplexity Decider 被称最好的决策模型:一项 8 个决策模型玩俄罗斯方块的基准测试显示,Perplexity Decider 在测试中持续位居榜首。1
- 智能体身份标识标准成关键问题:未来五年最重要的技术问题之一是建立被广泛接受的智能体身份标识标准,使服务提供商能据此调整与智能体流量的交互方式,区别于人类流量。预计未来约六个月内,智能体将展开规避检测的猫鼠游戏,以在增长阶段维持产品可用性,但这只是权宜之计,不会成为终局。1
二、产品与平台动态
- Airbnb 评论机制存在漏洞:房客若收到差评,可删除自己此前写的好评及其评分,从而变相报复;Airbnb 团队已向作者确认该做法,并指出有大量用户反馈评论被删除,与 Airbnb 官方“仅移除违规评论、房东无法删除”的说法相矛盾。有房东专门教程教如何删除房客评论,只需以“报复、敲诈、无关、隐私信息、歧视”为由申诉,其中歧视与敲诈成功率“非常高”,报复“高”,无关约五五开。1 2 3 4
- Perplexity Mac 版新增标签页:会话可开在独立窗口,支持并行运行任务或分屏放置,已在 Mac 版 26.37.1 向所有 Computer 用户上线,被定位为“用于重度多任务的空间画布”。1
- Computer 与 Computer 实时《星际争霸》对战:不暂停,各自 agent 思考时游戏继续运行;最终局蓝方未侦察红方建造,红方以 High Templar 的 Psionic Storm 打击蓝方部队,比分 Blue 2–Red 5。整套环境由 Computer 搭建:VPS 上基于 OpenBW 的 Brood War 运行时、C++ 桥接、每个 agent 四个游戏工具,各 agent 获得受战争迷雾限制的独立游戏状态,录制与镜头控制独立运行,agent 不接收视频输入。1
三、创业、政策与行业观察
- 斯坦福教授分享诺贝尔奖消息:斯坦福大学生物工程与精神病学及行为科学教授 Karl Deisseroth 与孩子们分享了自己获诺贝尔奖的消息。1
- 洛杉矶“豪宅税”被指阻碍住房建设:该税被宣传为向富人征税并促进住房,但实际阻碍了 9,100 套住房建设,抹去 16,650 个全职建筑岗位,并造成 4.52 亿美元收入损失。1
- 软件开发将迎来大爆发:开发成本骤降、世界上仍有大量自动化需求待完成,因此“有太多软件要写”。1
- 传统垂直软件机会:若从零开始创业,会瞄准医疗、物流、建筑、金融等仍运行在 1990 年代基础设施上的传统垂直软件,而非 AI 实验室;最可防御的业务常来自他人认为过于无聊的领域。1
