要点速览
- Hugging Face 发布基于 llama.cpp 的本地 AI 幻灯片,并预告 Mistral 4 即将上线。
- Hugging Face Decision Index v0.3 发布,新增私有半区与视觉能力;Perplexity 开源 pplx-decider-v1.1-27b 在该基准得分最高,输入 token 成本降至每百万 0.02 美元。
- RSI Arena 新一期与 Hugging Face 合作,让 AI 代理自行选数据、写代码、跑实验,社区投票实时回流。
- Grok 4.7 在 VulcanBench Frontier v4 编程任务基准登顶,前三名均为 Grok 4.7,并已在 Microsoft Foundry 上线。
- Anthropic 扩大 Cyber Verification Program,向经核实的网络安全专业人员开放最强模型,并新增授权攻击性安全工作的层级。
- OpenAI 发布一批由内部前沿模型生成的数学结果,并称发布方式参考了普林斯顿高等研究院独立顾问组的建议。
- NVIDIA 转发 FastVideo FastH3 信息:单台消费级设备可运行,FastH3 V2 在 8 步内超过基础版 MiniMax H3,单张 RTX 5090 生成带音频的 5 秒 480p 片段耗时 15 秒。
一、模型发布与基准评测
- Hugging Face 发布本地 AI 幻灯片,内容涵盖 prefill 与 decode、MoE 与 dense、显存与统一内存、量化到推测解码,均基于 llama.cpp,可署名复用;同时预告 Mistral 4 即将上线 Hugging Face。1 2
- Hugging Face Decision Index v0.3 发布,基准测试更强,新增强私有半区以衡量基准之外的技能,并加入视觉能力。Perplexity 发布开源多模态决策模型 pplx-decider-v1.1-27b,在新版 Decision Index 0.3 上得分最高,输入 token 成本为每百万 0.02 美元,仅为 v1 的一半;Perplexity Decision API 定价同步下调一半。1 2 3 4
- RSI Arena 新一期与 Hugging Face 合作:AI 代理自行选数据、写代码、跑实验训练模型,社区投票反馈实时回流给代理用于下一轮实验,Hugging Face Inference Endpoints 实时服务各代理训练的模型;目标是开放 RSI,所有模型、数据、代码及代理研究轨迹将开源。1
- Grok 4.7 在 VulcanBench Frontier v4 编程任务基准登顶,前三名均为 Grok 4.7,获胜成绩 93.15 分并通过全部 23 项任务;该模型已在 Microsoft Foundry 上线。另有转述称在政治倾向测试中 Grok 是唯一接近中间位置的主要 AI,Anthropic、Google、Meta、OpenAI 均偏左。1 2 3
二、安全、数学与开源生态
- Anthropic 扩大 Cyber Verification Program,让经核实的网络安全专业人员更广泛地访问其最强模型,包括 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,并配有面向防御性工作的安全措施;该计划还新增层级,允许经授权的攻击性安全工作,例如渗透测试和红队演练。1
- OpenAI 发布了一批由内部前沿模型生成的数学结果,并称在发布方式上咨询了普林斯顿高等研究院“数学与人工智能独立顾问组”,参考了其建议和公开推荐。有转述称 OpenAI 数学成果被 Opus 称为“史上最具影响力的数学发布”,但该说法以验证为前提;同一转述称 LLM 已在 7 个千禧年大奖难题中的 4 个取得实质进展,OpenAI 每个结果平均仅用 3 小时思考算力,运行于其未发布的新模型上。1 2
- Perplexity 开源 pplx-embed-v2-late 多向量嵌入模型,含 9B 与 0.6B 两个版本并共享同一嵌入空间,可用 9B 索引多模态数据、0.6B 在设备端查询,支持无需 OCR 检索 PDF 页面;在 MADQA 得分 92.4%、BrowseComp+ 得分 64%,权重已在 Hugging Face 发布。1
- NVIDIA 转发 FastVideo FastH3 信息:FastH3 现可在单台消费级设备运行,支持 NVIDIA RTX GPU、DGX Spark 和 Apple Silicon;FastH3 V2 在 8 步内超过基础版 MiniMax H3,单张 RTX 5090 生成带音频的 5 秒 480p 片段耗时 15 秒。同一来源还提到发布 FastH3 Trim,体积比基础 H3 小 4.2 倍,最低 8 GB GPU 显存即可运行,并称展示片段均为本地生成。1
三、产品与行业动态
- Grok Bot 被描述为可跨邮件、日历、Notion、Linear、Todoist 等自动处理事务:每约 2 小时扫描邮件并起草回复、会后把决策写入工具、离线时继续运行监控任务,并支持 @bot 在帖子或回复中触发摘要、提醒、起草等操作。作者称 SpaceX 今后会为不同任务选用最佳后端模型,包括 Claude Opus 5.5、MidJourney、Suno 等,简单问题路由到小模型、复杂问题路由到大模型。1 2 3 4 5 6 7 8 9
- Pollen 机器人 Microduck 换用首款全定制 SBC,由 Seeed 基于同款 Rockchip CPU 打造,改进内存、WiFi/BT、双 NFC 天线、状态 LED、RGB 手电及散热、走线、启动速度;首版到货一天内全部跑通。Microduck 可能在 10 月 16 日旧金山 Open Together 活动首次公开亮相;该活动因等候名单达 150 人且距活动 10 天而再次扩大容量。1 2 3
- Mistral AI 转发内容称,Mistral Large 4 发布时进行了盲测 Surge 人工评估,由专家软件工程师在编码质量上评测五个前沿模型;Le Chonk 在开放权重模型中排名第一、总排名第二,仅次于 Opus 5。该转发还称,单元测试只问“能否运行”,人工代码审查问“是否愿意合并”,其评估衡量的是这一差异。该账号另称 Mistral Large 4 是全球最强的网络安全 AI 模型之一,并可运行通用型智能体,在复杂工作流中收集信息并产出成品交付物。1 2 3
- Nano Banana 2.1 发布,为最新图像生成与编辑模型,据称在视觉设计、基于遮罩的编辑和主体一致性上较此前模型全面提升。SynthID Detector 已向所有人开放,可检测在线内容是否由 Google AI 或行业伙伴(含 OpenAI、NVIDIA、Kakao,Apple 即将加入)的工具生成。1 2
