要点速览
- Grok 4.7 发布:AA 智能指数 46 分,编程智能体指数 56 分,但 xhigh 推理下 token 消耗大幅上升。
- Grok 4.7 Fast 上线 Grok Build 与 Cursor,输出速度约 2 倍、token 价格为标准版 2 倍。
- Shopify 与 Muse 深度合作,将在所有 Shopify 店铺启用基于 Shop Pay 的 agentic checkout,PayPal 同步接入。
- Jev 相关 harness 与工具链持续扩展:TypeSafe API、HTTP API、OpenRouter 工具接入,并有成本与延迟实测数据。
- Legora 披露 ARR 从 1 亿到 2 亿美元不到 6 个月,月活律师 13 万。
- Naval 反驳 AI 恐慌论,认为 agent 集群入侵事件被夸大,责任应由构建者和使用者承担。
- Andrew Wilkinson 讨论风投语境下“失败”的定义,以及收购被低估公司的机会。
一、AI 模型与基础设施
- Grok 4.7 发布,Artificial Analysis Intelligence Index 得分 46,较 Grok 4.6 提升 2 分,在 xhigh 推理强度下评测;该账号称其在智能体编程上位列 Anthropic 与 OpenAI 之后第三,并强调速度更快、成本更低。引用评测显示,Grok 4.7 在 AA-Briefcase 得 1657 Elo(较 4.6 高版 +111),GDPval-AA 得 1695 Elo(+90),编程智能体指数 56 分(+9),原生框架下排名第 4,仅次于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。1
- 代价是 token 消耗大幅上升:Grok 4.7(xhigh)每个 Intelligence Index 任务约用 81k 输出 token,Grok 4.6(high)为 36k,GPT-6 Astra(max)为 27k,分别高出 125% 和 196%;上下文窗口 500k 不变,定价 $2/$6 每百万输入/输出 token、缓存命中 $0.50,与 4.6 一致。模型卡对比 4.6 的提升包括:Terminal-Bench 20.3%→38.0%、SWE-Marathon 31.9%→46.0%、HealthBench Pro 48.5%→56.7%、Legal Agent 15.8%→19.6%、EEBench 60.0%→66.0%,价格不变;另有说法称 Terminal-Bench 两个月内从 12.4% 升至 38.0%,超过 GPT-5.6 Sol。1 2 3
- 该账号多次强调需搭配 Grok Build harness 才能获得最佳效果,并称 Grok 4.7 与 Build harness 是“强大的日常主力”;转发内容称 Grok 4.7 Fast 已在 Grok Build 和 Cursor 上线,输出速度约 2 倍,token 价格为标准版 2 倍,不含免费层、不在公开 xAI API 提供。其他转发提及的应用与评测包括:法律智能体基准得 19.6%、约为 Fable 5.1 的近 3 倍;AA-Briefcase 上 xHigh 得 58%,距 Claude Fable 5.1 Max 的 59% 仅 1 分;音乐错误检测得 100%;有用户称其连续工作超 70 小时、500k 上下文对技能选择和工作流帮助明显。1 2 3 4 5 6 7 8
- Grok 4.7 已在 Vercel 的 AI Gateway、fx 和 @eve 上线,9 月 27 日前全部八折;Guillermo Rauch 称其“快、聪明、便宜”三者兼得。1
二、Agentic 商业与工具链
- Shopify 与 Muse 深度合作,将在所有 Shopify 店铺启用由 Shop Pay 支持的 agentic checkout,提供更便捷的购物与结账体验。Mark Zuckerberg 表示,与 Shopify 合作在 Muse 中简化购物与结账流程,目标是让消费者更容易找到商品、商家卖出更多,并称后续还会有更多类似合作;Shopify 方面表示正与 Muse 深度合作,在所有 Shopify 商店启用基于 Shop Pay 的 agentic checkout。转发内容还提到,与 Meta 合作使 PayPal 客户能通过 Muse 个人 AI 代理在 PayPal 全球商户处无缝购物和结账。1 2 3 4
- Jev 相关工具链持续扩展:除类型安全的 TypeSafe @aisdk API 外,Jev 现可通过 AI Gateway 以 HTTP 方式调用,新增 TypeSafe 兼容 API(相同 eval 调用)和面向任意语言或框架的 HTTP API 两种方式。Yohei 转发介绍 Jev + OpenRouter + tools:可在 Monid 上使用 2,000 个工具,由 agent 选择工具,Jev 将工作提速 30 倍,示例任务包括给 2,000 条线索打分、扫描 TikTok 爆款视频钩子、调研 200 家公司融资、审计网站 SEO 并重建每页内链、整理某品类的所有 Reddit 帖子。1 2
- Jev 风格 logit 读取在 4B 开源 VLM 上实测:相比同一模型输出 JSON,对整张照片做 yes/no 判断耗时少约 1/3,每图多问题时 GPU 成本最多降低约 85%,准确率相同;新照片上 pick-one 与最佳托管模型持平(0.933 vs 0.937),yes/no 落后 Gemini 约 2 个百分点。作者发布 glance-qwen3-vl-4b 决策模型,称“热狗或不是”判断耗时 0.4 秒,已上线 Hugging Face 和 Replicate;并称该模型快到可用于实时情绪检测,被引用推文称情绪读取耗时 0.34 秒。1 2 3
- 转发内容介绍用 @typesafeai 的 Jev 构建的新 harness,可将重复性工作成本降低 90%,运行时学习任务并把步骤从 LLM 调用转为代码;10 万条合规告警在 Opus 5 上成本超 29 万美元,用 agentrun() 降至不到 2.6 万美元。转发观点认为 harness 的终态是:后端为给模型最大自由度的执行环境,前端为模型与用户沟通的自由画布。1 2
- Legora 数据:从 100 万到 1 亿美元 ARR 用 18 个月,第二个 1 亿不到 6 个月,上周突破 2 亿美元 ARR;月活律师 13 万,覆盖 2100 家律所和法律团队、80 多个国家,美国为收入最大市场,超 40% 新客户为内部法务团队。1
三、行业观点与争议
- Naval 反驳 AI 恐慌论:他认为过去两周 AI 危险论调被一场疑似有组织的公关活动放大,AI 技术并未出现意外的危险转折,这对该领域是挫折;AI 灭绝风险相较几个月前没有上升,相关理论仍是科幻式设想;最大变化是网络安全能力,值得重视但不会导致世界末日。针对 OpenAI 团队部署 agent 集群入侵 Hugging Face 一事,他认为媒体报道夸大:所谓 1,200 个 agent 攻击在技术上属实,但他笔记本电脑上就运行着约 1,300 个进程,大规模并行并非魔法能力;OpenAI 沙箱与监控的漏洞是关键诱因,应修复漏洞和改进监控而非暂停 AI。1
- Naval 认为 AI agent 的优势在于不知疲倦地尝试多种攻击手法并串联漏洞,但长期看防御方占优(掌握更多信息以定位并修复漏洞),识别和利用漏洞仍有瓶颈,因此即便易获得削弱护栏的开源模型,世界也未终结。他反对将 AI 拟人化:若用锤子砸坏墙,责任在使用者而非锤子;agent 入侵他人系统应由提示者负责。他批评 AI 公司以“失控的 agent 干的”推卸责任,主张由构建者和使用者担责,并称暂停 AI 十年会同时推迟安全工程修复、且对手不会减速,收益应用仍远超风险。1
- Andrew Wilkinson 讨论风投语境下“失败”的定义:若初创公司年收入增速未达 100% 即被视为失败,即便拥有好产品、满意客户、投入的团队和数百万美元收入,仅增长 30% 也可能无法再融资并被迫关停、裁员、停掉产品。他认为这完全源于激励机制——创始人股权因 VC 清算优先权堆叠而一文不值,投资人则追求 20 倍回报或归零。1
- Wilkinson 指出,投资人急于脱身时往往愿意以极低价出售股权并抹掉清算优先权,这为创始人和 Tiny 这类控股公司创造了机会:收购这些“看似失败”的公司,削减风投式增长开支,转向盈利。他列举 Abstract、CreativeMarket、BeFunky、Meteor 等案例,称通过买断风投股东、压缩开支实现扭亏;并给出一组示例:收入 500 万美元、工资 200 万、费用 200 万、营销 500 万、亏损 400 万,调整为费用 100 万、营销 50 万后,利润为正 150 万。1
- Sam Altman 主张 AI 实验室之外的人应对技术发展有真正发言权,并能明确判断其是否安全推进;标准应防止权力集中,包括确保新公司和开放模型公司能够竞争,也应帮助各国和企业比较证据、从失败中学习;他认为美国应主导这一努力,并附上了其提案。1
四、其他值得关注
- QM v0.1.12 发布,包含 alpha 阶段的 agent fleets、更简便的 Slack 设置、更好的应用编辑与发布及可靠性修复。1
- Aravind Srinivas 称 Claude Opus 5.5 已向所有 Perplexity Computer 用户开放;在其 Wide-And-Deep-Research 评测中,该模型表现优于 Fable 5.1,且成本仅为后者一小部分。Opus 5.5 将成为所有 Pro 和 Max 用户在 Computer 上的“Standard” Effort orchestrator。1
- Paul Graham 指出,过去两年新闻网站的网络流量下降约 28%。1
- Nikita Bier 判断,未来几年机器人检测与真人验证将成为企业最紧迫的需求之一:智能体集群会淹没各类网站和表单,小公司和政府网站最脆弱。他称该市场目前存在巨大空白,X 在评估市面方案时未找到任何一家公司整合了最新技术,因此只能全部自研。1
- @TallyForms 在完全自举、纯产品驱动、10 人团队、超 250 万用户的情况下达到 600 万美元 ARR,并分享从 500 万到 600 万美元 ARR 过程中的经历与失误。1
