要点速览
- Qwen Image 2.1 发布:7B 原生图像生成与编辑模型,支持最多 10 张参考图,KV Caching 实测加速 2.55 倍。
- Tokenizers v1 首个候选版发布,分词速度最高提升 30 倍,将登陆 transformers。
- eidon_ai 停运后以 CC-BY-4.0 开放全部数据:1,274 小时第一人称视频、13,451 段录制、9 TB。
- zerank-2 为 4B 开源重排序模型,可返回置信度分数并当分类器使用。
- Perplexity Computer 接入 Seedance 与 MiniMax H3,面向 Pro 和 Max 用户开放视频生成。
- Runway 将于 9 月 30 日在旧金山举办线下黑客松,提交可运行 demo 可角逐 2.5 万美元与 20 万 credits。
- Yann LeCun 否认曾要求停止 LLM 研发,重申 LLM 有用但仍是通往人类水平 AI 的“出口匝道”。
一、AI 模型与基础设施
- Qwen Image 2.1 发布,为 7B 参数原生图像生成与编辑模型,支持最多 10 张图像参考,自带提示增强 LLM,已集成 diffusers 与 ComfyUI。其 KV Caching 将固定上下文与每步去噪变化的图像位置分离,固定部分只缓存一次,后续步骤成本大幅降低,实测加速 2.55 倍。1 2
- Tokenizers v1 首个候选版本发布,分词速度最高提升 30 倍,支持多线程扩展,延迟更低、内存占用更少、crate 体积极小;Rust 实现版本提速 3 至 30 倍,含可选退出的分词训练 crate,将登陆 transformers。1 2
- zerank-2 是 4B 开源重排序模型,同时返回置信度分数,可设阈值当分类器使用,支持通过 baseten 或 FireworksAI_HQ 自托管。1 另有转发观点认为,大型通用模型之外,更专用、面向特定任务和语言定制的模型机会巨大,成本、速度和优化可好上数个量级,Hugging Face 上已有 300 万个此类公开模型。2
二、开源数据与产品动态
- 机器人公司 eidon_ai 停运后以 CC-BY-4.0 协议开放全部数据:1,274 小时第一人称视角视频,配 7-IMU 手臂追踪,共 13,451 段录制、9 TB,内容为洗衣、清洁、洗碗、做饭等日常任务。转发评论认为这使工作成果超越组织本身,开源让成果在创建它的公司消失后继续存在,更多初创公司应效仿。1 2
- Perplexity Computer 已接入 Seedance 和 MiniMax H3,用于详细视频生成工作流,最适合需要将多个不同工具与视频模型配合使用的网页应用和创意素材制作场景。用户可在同一对话线程中请求活动短片、产品演示或社交素材,并同时获得成品视频与文案、创意内容;该功能已面向 Pro 和 Max 订阅用户开放。1
- Runway 将于 9 月 30 日在旧金山 Masonic 举办为期一天的线下黑客松,与 Runway AI Summit 同场,目标是使用 Runway API 构建 agent、应用或创意工作流。该活动不设 pitch deck 和审批流程,要求下午 5 点前提交可运行 demo,参与者有机会获得 2.5 万美元和 20 万 credits。1
三、行业观点与争议
- Yann LeCun 否认曾要求停止大语言模型研发,称自己一直支持 Meta 的 LLM 工作,并列举 Galactica(2022 年 11 月)、OPT-175B 开源(2022 年 5 月)及 Llama 系列(2023 年中)为例;他还称曾于 2023 年 1 月推动 Meta 领导层成立以 Llama 为核心的 AI 优先产品部门。他重申 LLM 令人印象深刻、有用且潜力巨大,但始终认为它们是通往人类水平 AI 路径上的“出口匝道”,并否认曾阻碍 Meta 的 LLM 研发。1
- 争议/待证实:被引用推文称,作者在参与共同发明 ChatGPT 后,用两年时间秘密研发新的训练方式 RLCD 及新型前沿 AI 模型 Jev,并于当日发布;其宣称 Jev 速度提升 20–200 倍、成本降低 40–400 倍(输出 token 免费),定位为面向决策的前沿可组合智能。Hamel Husain 反对为 Jev 另造“Decision Model”这一新术语,主张沿用“classifier(分类器)”,认为这是已有成熟术语,能准确描述其功能,并有对应的验证、调优、度量文献;Jev 因速度、成本、准确性和易用性而有用,但新术语可能弊大于利。1 2 3
- Ethan Mollick 指出,长期运行的 LLM 代理任务中,最恼人的问题不是编码、错误或幻觉,而是任务推进过程中语言质量因漂移而下降。1 他将“需要快速、前瞻性 AI 研究”的观点扩展到整个社会科学领域,认为当前处于未知水域,这类研究在学科内通常地位不高但至关重要;被引用观点指出,经济学界习惯超干净识别与顶刊标准,但这类研究耗时数年甚至数十年,当下也需要更嘈杂但方法可信的即时信号,通过多角度独立研究累积结论,例如 AI 暴露度与早期职业招聘论文已让多个独立团队得出“AI 暴露岗位的早期招聘似乎在放缓”的相近结论。2
