要点速览
- H-JEPA 将 JEPA 世界模型按多时间尺度堆叠,在 Visual AntMaze 上把成功率从 18% 提升到 73%,且规划器算力更少。
- RoboJEPA 以 8B 参数、15,022 小时视频训练,真实 Franka 上无任务微调抓取成功率 67%,但 pick-and-place 仍落后 π0.5。
- OpenAI 向所有 ChatGPT 用户推送 GPT-6 与 Intelligent UI,支持在对话中即时生成交互式界面。
- EmbeddingGemma 2 与 Perplexity Decider v1.1 相继发布,前者为首个开放原生多模态嵌入模型,后者以开放权重进入决策模型赛道。
- Starlink 在印度已完成网关、牌照与数据本地化准备,但最终许可和频谱未落地,波束仍处关闭状态。
- NVIDIA 发布 CUDA 13.4,并宣布捷豹路虎新款 Jaguar Type 01 搭载 Hyperion 与 Halos。
- 关于 OpenAI 数学成果与 AGI 的判断在转发中引发争议,相关说法以验证为前提。
一、AI 模型与基础设施
- H-JEPA 将 JEPA 世界模型按多个时间尺度堆叠:高层先预测较远的未来并确定大致目标,低层逐级转化为具体子目标,底层输出动作;在 Visual AntMaze 上,3 层设置把成功率从 18% 提升到 73%,且规划器算力更少。1
- RoboJEPA(FAIR at Meta + Mila)在 V-JEPA 2.1 特征空间想象未来并朝单一目标图像规划,用 23 个公开数据集、12 种机器人本体、15,022 小时视频(其中 6,692 小时含动作)训练 8B 参数 JEPA,作者称其为迄今最大 JEPA 预测器;在 22M–2B 模型上拟合的缩放律能准确预测 4B 和 8B 结果,技能随算力增长依次解锁。真实 Franka 上无任务微调时 8B 抓取成功率 67%,π0.5 为 5%,但目标图像与文本输入并非完全可比,π0.5 在 pick-and-place 上仍以 53% 对 27% 领先。1
- OpenAI 宣布 GPT-6 与 Intelligent UI 已向所有 ChatGPT 用户推送,Intelligent UI 提供快速交互式回答,使日常问题更可视化、复杂主题更易理解,并可在对话中直接调用交互工具;Sam Altman 表示 ChatGPT 现在可以为用户生成自定义 UI。相关转发称,Intelligent UI 是对模型智能的一次押注,让 GPT-6 用高实用性的可视化与交互组件填充画布,为此需为 GPT-6 打造合适工具,使生成的界面 token 高效、即时流式呈现、符合其设计语言。1 2 3 Runway 同时宣布可在 ChatGPT 内直接使用 Astra,用户可在同一聊天窗口完成下达简要指令、让其执行、再给反馈的流程。4
- EmbeddingGemma 2 发布,为基于 Gemma 4 的首个原生多模态嵌入模型,Apache 2.0 许可,可将 100+ 语言、代码、图像、音频和视频嵌入同一向量;提供 8192 上下文,参数规模 740M omni、440M 文本+视觉、570M 文本+音频、270M 纯文本,MTEB Code 提升 14%,支持 Matryoshka 768/512/256/128 维,已在 Sentence Transformers 和 LiteRT-LM 提供。1 2 Demis Hassabis 介绍其为首个开放、原生多模态嵌入模型,采用 740M 参数的轻量模块化架构,面向离线、隐私优先的 RAG(搭配 Gemma 4),性能超过部分参数量为其两倍以上的专用模型,权重已在 Hugging Face 发布。3
- Perplexity Decider v1.1 已在 OpenRouter 上线,为开放权重多模态决策模型,可接收文本、JSON 或图像并返回带概率的类型化答案,输入价格 $0.02/M,输出免费。作者称其在临床决策上质量最佳、成本最低:pplx-decider v1.1 在临床决策测试中答对 643/669,对比 Jev 的 628,单次决策成本低 42%,速度大致相当,且权重可下载并在医院内部运行;在 DecisionBench 上排名第一且成本最低,949 个共享文本案例中准确率 93.9%,中位延迟 534 ms,成本 $0.016/1k 次决策。1 2 3 4
- NVIDIA 发布 CUDA 13.4,并附“What's New”说明链接。1 2 英伟达宣布捷豹路虎新款 Jaguar Type 01 搭载其技术:采用 NVIDIA Hyperion 计算与传感器平台,实时处理车辆感知信息并辅助决策;配套 NVIDIA Halos 安全系统覆盖芯片到软件,软件上路前已通过 15 万项测试、耗时数万小时,并支持 OTA 持续更新。3
二、开源生态与工具链
- Hugging Face 转发信息显示,MiMo 2.6 Flash 的原生 mxfp4 权重可在 RTX 6000 GPU 与 M5 笔记本间通过 10 GbE 以 40 tokens/秒 运行,llama.cpp 开箱支持;llama.cpp 还能通过 ggml RPC 后端在异构设备上分布式推理,目前属高级设置。1 2
- Open d1 决策模型家族发布两个开放权重多模态模型:d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频,面向从 NVIDIA DGX、RTX 工作站到 Jetson 边缘的实时决策;Hugging Face 新增“decision-model”标签,已有 1300+ 模型。d1-omni-600M 已通过 Core ML 在 Apple 芯片运行,在 M5 Pro 上以 GPU+ANE 处理 Civil Comments 的 5000 条真实评论,达 224 条/秒,与人类评分者一致率 95.4%,与基础 PyTorch 版本相同。1 2 3 4 5 6
- Perplexity 在 Hugging Face 以 MIT 许可发布 pplx-embed-v2-late,含 0.6B 和 9B 两种规模,基于 Qwen3.5,采用 ColBERT 式 late-interaction 检索,每 token 生成 128 维向量,支持文本、图像及 PDF/幻灯片等渲染页面;两规模共享嵌入空间,ViDoRe v3 图像赛道 nDCG@10 分别为 62.3% 和 65.2%,均蒸馏自内部 18B 教师模型,但逐 token 存储使索引较大。1
- Mellum2.1 发布,为 6 月开源的 Mellum2 的重大更新,通过大幅扩展 RL 后训练支持 agentic coding 工作流,在同类速度下取得 agentic coding 基准最高分;权重以 HF 和 GGUF 格式发布,MTP 支持将在后续几天推出。1 其他进展包括:RL Environment Explorer 上线,Hugging Face Hub 已有 1200 万+ RL 任务条目,覆盖 OpenEnv、Harbor、MiMo、Verifiers、NeMo Gym;Open Env Arena 启动,平台用 Qwen-3.8-27B 训练并评估,接入 Nebius AI GPU、运行于 benchflow_ai 的 PostTrainArena,首轮覆盖 8 个领域的留出任务。2 3
- Carbon-A 模型及 Carbon Annotation Database 发布,已用于在 22617 个物种中发现 5.6634 亿个新基因候选,其中数千个此前未被如此研究;与 Active Site 和 UCSD 合作在猫、鸡、拟南芥等已充分研究物种中对部分新基因做了湿实验验证。最大规模 agentic LLM 推理数据集发布,含 2060 亿 token、12002 个会话、1186582 次 LLM 请求、1213347 次工具调用,轨迹包含工具名称、参数、时长等,论文即将发布。1 2
三、产业动态与争议
- Starlink 在印度获批前已建成 20 多个网关站点、取得电信牌照和 IN-SPACe 批准,并按印度安全要求将用户数据留在境内,但最终许可和频谱分配仍未落地,尚不能服务任何商业客户。印度约 64% 人口、约 9.41 亿人生活在农村;截至 2026 年 5 月仍有 11,256 个列入名单的村庄无 4G 覆盖,2026 年 3 月农村互联网订阅密度为每百人 48.31,城市为 126.80。作者称 Starlink 在印度的波束处于关闭状态,因此有关其在印度被任何人使用的说法完全不实;他质疑 Starlink 已在 165 个以上国家获许可、并花五年遵守印度所有法律要求却仍无牌照,并点名问“Ambani 是不是印度真正的老板”。另有转述称,印度电信市场现由 Jio 和 Airtel 占近 77% 无线订阅,引入 Starlink 可增加竞争。1 2 3 4 5 6 7 8
- Starlink Mobile 已通过与 banglalink 合作在孟加拉国上线,可为兼容手机在蜂窝盲区提供应用消息、位置共享和连接。作者称 Starlink 将帮助印度网络覆盖差、甚至无移动信号的地区,并认为反对者只伤害最缺乏服务的人群。FCC 已批准 SpaceX 部署最多 15,000 颗下一代 Starlink 卫星,用于直连手机服务,速度最高 150 Mbps 并具备完整 5G 能力。KLM 选择 Starlink 为机队提供连接,免费高速 Wi-Fi 将于 2027 年中起在洲际航班推出,目标 2028 年中覆盖全机队;法航已在使用 Starlink。1 2 3 4 5 6
- Grok Bot 近期更新包括:主动式主机器人、无需 API 密钥的 X 搜索与监控、更快回复、聊天内生成幻灯片、在 X 上 @bot 下达指令、按任务选择最佳模型。作者称多数 Bot 请求较简单,将由 Grok 4.8 的极速版本处理,目标是兼顾速度与智能。有用户称 Grok Bot 接入 X 信源后的研究表现优于 GPT-6 Pro,并指出后者遗漏了 Zhipu 超 80% 收入来自中国这一关键信息。SpaceXAI 向 DHH 的开源 Linux 系统 Omarchy 捐赠 150 万美元 Grok 代币,Grok 4.7 将驱动代码审查 AI 代理。1 2 3 4
- 争议/待证实:转发内容称 OpenAI 的数学成果被 Opus 称为“有史以来最具影响力的数学发布”,LLM 已在 7 个千禧年大奖难题中的 4 个取得实质进展:Navier-Stokes(声称)、Riemann、Hodge 和 Birch-Swinnerton-Dyer;Poincaré 于 2003 年解决,剩余 P vs NP 和 Yang-Mills,上述以验证为前提。该转发内容还称,OpenAI 每项结果平均仅用其未发布新模型 3 小时思考算力;两年前模型还认为 9.11 > 9.9,如今已取得最聪明人类终生未能实现的成果,表明数据、算力和算法均可扩展,每代模型(3 个月)都有实质智能进步。该转发内容认为,按“在几乎所有认知任务上超越人类”的 AGI 定义,多数解读下已经实现 AGI;AI 尚不能做的事更可能是上下文受限(缺乏正确信息),而非智能受限,也可能是创造力或判断力受限,人类仍占优的领域包括机器人/物理世界控制、自然科学研究、部分创意领域、超长任务、选择要解决的问题及人际关系管理。1
- 争议/待证实:OpenAI 376 篇论文清单中明显缺少密码学,Scott Aaronson(UT Austin 计算机科学系主任)称其消息源显示,AI 公司已开始谨慎、低调地研究其最新内部模型能否破解重要密码协议与基础原语。1 美国劳工部已暂停对知名印度 IT 公司(Wipro、Infosys、TCS、Cognizant、HCL、Capgemini)以及 Microsoft 和 Adobe 的新提交和待处理 PERM 申请,这意味着其 H-1B 员工将受 6 年上限约束且无法延期,也没有绿卡途径。2
