要点速览
- SpaceX星舰首次轨道飞行成功,超重型助推器溅落墨西哥湾,星舰入轨并首次将Starlink V3卫星送入太空。
- Anthropic发布Claude Sonnet 5.5,速度提升逾30%,多数工作场景成本最多降低30%。
- Perplexity Agent API新增Profiles、Skills和托管连接器,Profiles和Skills已上线,连接器处于预览阶段。
- Runway上线ElevenLabs v4,可与Runway的图像和视频模型一同使用。
- 英伟达联合逾100家行业伙伴推出Open Agent Safety Platform,吴恩达参与的OpenWorker基于Nvidia OpenShell构建。
- Hugging Face重新设计Gradio并发布Holo4通用计算机使用模型。
- 吴恩达宣布Workera被Pearson收购。
一、AI模型与基础设施
- Anthropic发布Claude Sonnet 5.5,称其为Claude 5.5系列第二个模型,相比Sonnet 5明显升级,运行速度提升逾30%,多数工作场景成本最多降低30%。Ben Tossell称Sonnet 5.5已在Factory上线,初步观察包括High是较强的默认档位、会核查真实需求是否被满足而不只是让最近的失败测试通过、会对沿用自早期工作的解释提出质疑。1 2
- Runway上线ElevenLabs v4,该模型在旁白和角色对话方面表现突出,表达力和语调自然度均超过以往版本,即日起可与Runway的图像和视频模型一同使用。1
- Perplexity Agent API新增Profiles、Skills和托管连接器:Profile是可保存的agent配置(模型、指令、工具、连接器、运行设置),统一在版本化ID下由项目管理员配置一次,项目内开发者用项目API key即可调用;Skills支持版本化,可不改动各集成直接发布流程v2;连接器首批支持GitHub、Slack、Drive、Datadog、Linear、Notion,由管理员统一配置,应用无需自持凭证。Profiles和Skills已上线,连接器处于预览阶段。1 2
- Hugging Face就Gradio发起功能需求征集,称发布五年后“为AI应用构建前端”已不再是主要障碍,正根据开发者反馈从零重新设计Gradio。同时发布Holo4,新一批通用计算机使用模型,可跨桌面、网页、Android、代码沙箱、MCP服务器和企业API执行点击、写代码和调用工具,已在H Models API上供商业使用。1 2
二、AI安全与治理
- 英伟达联合逾100家行业伙伴推出NVIDIA Open Agent Safety Platform,整合OpenShell与Sentry,定位为构建安全智能体系统信任层的开放生态起点。吴恩达指出OpenAI-Hugging Face被攻击事件源于沙箱机制薄弱,称英伟达发布开源AI智能体沙箱工具是积极进展;他参与的OpenWorker基于Nvidia OpenShell构建,将支持在沙箱内运行每个智能体的命令,仅放入任务相关文件,默认无法访问密钥、浏览器登录凭据和任意网站,限制由确定性代码而非易出错、易受提示注入的LLM提示实现,且所有操作留痕以供监控审计。1
- OpenAI发布文章,介绍其对前沿强化学习训练运行安全防护的思考。Greg Brockman转引并强调一份关于前沿强化学习训练安全防护的实用指南,称其反映了当前的经验总结。1 2
- Aravind Srinivas评论“AI安全是一个工程问题”;被引用推文称agent治理是工程问题,Perplexity已在基础设施、harness和工具中内置防护措施并应用于各产品,并分享了其工程化更安全agent的做法。1
三、行业动态与观点
- 吴恩达宣布Workera被Pearson收购,称2019年Kian Katan就判断严格的技能测量将变得重要,而AI进展使这一判断更成立;Workera的技能测量技术帮助企业了解员工优势与发展空间,合并后在Omar Abbosh和Kian领导下有望服务更多人。Kian表示,与Omar Abbosh交流后确认双方使命一致,Pearson的全球规模与学习评估专长结合Workera的技术和AI人才,可让使命以自身难以想象的规模推进。1
- Ethan Mollick认为AI对就业的影响仍很不明确,雇主还在摸索个人层面的采用,更不用说在复杂组织中如何使用AI;随着能承担实际工作的agent普及,变化可能加快。被引用推文称,综合约20篇论文,AI尚未在总量上冲击劳动力市场,失业与裁员几乎无变化,但可能已在削减受AI影响的白领初级招聘,远程办公或可解释部分下降。1
- Hamel Husain对Anthropic新发布的评估工具给出评价:不足在于工作流先写评估再看数据、用markdown文件而非自建标注应用、评估范围过宽且捆绑多种失败类型、过早陷入单个评估细节;优点是开箱即用的问题发现能力是同类自动评估中最强的,能发现人工转接、格式、语音代理等问题,UX较此前评估插件大幅改进。他转发的信息称,评估经验正成为PM岗位的常见要求:上周分享的25个PM职位中近半要求评估经验。1 2
- Deedy分享用Opus 5.5做视频生成工作流的经验:在Claude Code而非应用内使用,经OpenRouter API一个密钥调用图像、视频、音频等模型;关键帧用GPT 2.5 Image Sunburst,生成用Veo 3.1 / Seedance 2.5,称Seedance更擅长运动镜头;需准备参考图保证一致性,并在完整视频前先生成动态分镜。1
