要点速览
- Perplexity 推出 Decisions API,由多模态决策模型 pplx-decider-v1-27b 驱动,输出固定答案集上的概率分布而非文本,定价每百万输入 token 0.04 美元,基准测试得分 85.71%。
- SpaceX 完成 Crew-13 载人发射并与国际空间站对接,同时执行 Transporter-18 和 NROL-97 任务,共 4 枚助推器着陆。
- Starlink 机上 Wi-Fi 在阿拉斯加航空集团超过 40% 机队完成安装,夏威夷航空长途机队及阿拉斯加航空区域机队全部完成。
- Grok Bot 更新,可主动建议帮助、识别聊天中的图像和文本,并接管编码任务、管理 PR。
- YouTube 调整短视频推荐算法,优先原创内容,降低未添加自身内容的重上传内容传播。
- Basecamp 上线 Bonfire 功能,并支持人与 agent 在同一处协作。
- 有观点称,若任务可验证,AI 已能满分完成会计任务,而人类耗时更多且错误较多。
一、AI 模型与基础设施
- Perplexity 推出 Decisions API,由多模态决策模型 pplx-decider-v1-27b 驱动,该模型输出固定答案集上的概率分布而非文本;定价为每百万输入 token 0.04 美元,基准测试得分 85.71%。作者表示将开源该多模态决策模型 pplx-decider-27b,Decisions API 输出 token 免费,并计划在未来数日进一步降价。1 2
- Grok Bot 更新:可主动建议帮助、响应更快,能识别聊天中的图像和文本并在被直接提及时回应;可接管编码任务并交接给 Cursor、通过 GitHub 和 Origin 插件管理 PR、分享构建视频演示,SpaceXAI 公开了其工程团队内部使用的 Bot 模板,含工程负责人、QA、夜间代码审计、项目管理、研究事实核查、监督云端编码代理、写代码与问题分诊等。1 2 3 4 5 6
- 有观点称,若任务可验证,AI 现已解决此类任务:18 个月前最佳模型低于会计师平均约 37% 的得分,如今模型可满分完成;Opus 5.5 几乎即时以 100% 准确率解决所有会计任务,而人类耗时更多且错误较多。1 2
二、航天与卫星网络
- SpaceX 完成 Crew-13 载人发射并与国际空间站对接,同时 Falcon 9 执行 Transporter-18 任务将 130 个载荷送入轨道,Falcon Heavy 完成 NROL-97 发射(NRO 首次使用 Falcon Heavy),共 4 枚助推器着陆。1 2 3 4 5 6 7 8 9 10 11 12 13
- Starlink 机上 Wi-Fi 进展:阿拉斯加航空集团已在超过 40% 机队完成安装,夏威夷航空长途机队及阿拉斯加航空区域机队全部完成;有推文称机上 Wi-Fi 将于 2027 年推出。1 2
- SpaceX 的 Star Mind 超级智能航天器将配备超过 250kW 太阳能电力,比国际空间站高约 20%;被引用推文称各代卫星部署尺寸约每代翻倍(Starlink V1.5 约 11 米、V2 Mini 约 30 米、V3 约 60 米,AI1 翼展约 75 米)。1
三、平台与产品更新
- YouTube 将调整短视频推荐算法,进一步优先原创内容,降低未添加自身内容的重上传内容的传播,以重上传为主的频道在 Shorts 信息流中分发将减少。被引用推文称此举意在突出有真实价值的内容,不鼓励“细微技术性剪辑”和“模板化”改动,并认为这基本涵盖了行业内剪辑搬运的做法;该推文评价称,这会得罪一些靠他人内容建立职业生涯的人(主要是剪辑号),但这一改变本身很好,将解决长期存在的整体质量问题。1
- Basecamp 上线新功能 Bonfire,该功能十余年前就开始探索但从未发布,最初为聊天工具 Campfire 设计;Campfire 并入 Basecamp 后 Bonfire 归入其中,现已面向所有 Basecamp 5 客户开放。作者称 22 年前推出 Basecamp 时没想到它会成为让人与 agent 在同一处协作的最佳框架:@bitsweat 在 Basecamp 中给 agent Clawdito 派活、获取回复、要求跟进并创建 PR;@jasonzimdars 在留言板评论线程中与 agent Marie 及自己的 agent JZ bot 协作。该能力适用于 Basecamp 内待办、卡片、文件、文档、照片等任何可与人异步或实时交流的位置,agent 像人一样在对话流中回复并保留线程上下文;团队已在自有账号中运行和打磨一段时间,目前任何人可通过 CLI 使用,官方还将简化在 Basecamp 内创建 agent 用户的方式。1 2
- Shopify 在《福布斯》全球最佳雇主榜单位列第 3,转发内容称这家“AI 最前沿的公司”员工喜欢在此工作。作者称团队推出 Canvas 超出预期,认为它让在线商店设计变得有趣且民主化,并强调其仍由 Liquid 驱动。被引用推文称,12 年前为 @kotn 建首个商店时即使会编程也花两周才做出尚可的版本、数年才满意,Canvas 是他们当时希望拥有的工具。转发内容称 Shopify 为让网络更美而“过度投入”Editions 等项目,Canvas 延续同一目标:鉴于 AI 容易生成同质内容,团队花大量时间引导 Sidekick 做出好的设计决策,同时给用户空间做出独特作品。1 2 3
四、开发者与创业观察
- Guillermo Rauch 提出“验证工程”是未来方向,涵盖证明、端到端测试、基准测试和 linter,并认为测试将分为确定性测试与 agentic 测试两类。作者转发介绍 e2e:一个面向任意应用的 agentic 测试框架,可通过
npx e2e init初始化,完全开源,支持混合确定性与 agentic API,覆盖 web、移动端等,可自带 agent 和基础设施,支持本地或 CI 运行。作者称 SvelteKit 3 表现出色,期待 Async Svelte 与 Remote Functions;其构建的小应用端到端构建并部署仅用 15 秒,体验即时,且 fx 与 opus 能轻松完成全部工作。1 2 - 部分前置部署工程师(FDE)年薪可达 100 万美元以上,但作者指出网上几乎没有人详细讲他们具体怎么做,因此请一位长期为财富 500 强公司做该工作的人逐步讲解。该 FDE 的做法:先倾听而非直接构建,访谈实际做事的人,并让 agent 安静读取公司数据数周;真实流程通常比纸面上的流程长 3 倍。把每个步骤分入四类:删除、用简单规则自动化、交给 AI agent、保留人工;作者称相当一部分最终落入“删除”一类。在公司现有工具内构建,不要求员工学新应用,需要人工签核时只用一条 Slack 消息;并使用能完成任务的最便宜模型,因为多数工作不需要最贵的 AI。对前后都做测量,6 个月后回来证明其有效;作者称该期播客还包含具体客户案例,相当于一门免费完整课程,面向想做 FDE 或想让公司通过部署 agent 实现 AI 原生的人。1
- Paul Graham 认为 AI 创业公司增长极快,估值因此变得很高,不仅因为 AI 是新热点,还因为许多 AI 创业公司确实有惊人的数据。1
