要点速览
- OpenAI 暂停计划部署最新模型的强化学习训练两周,并保持最大规模前沿 RL 训练暂停,以加固安全与监控;Sam Altman 表示能力若超出安全对齐速度就会行动,呼吁行业协调安全标准。— 来源:1 2
- Anthropic 的 Claude 成功从零设计新型蛋白质结合剂,15 个靶点中成功 14 个,并由外部机构独立验证;Yann LeCun 认为主要功劳应归于开源蛋白质工具。— 来源:1 2
- DeepSeek V4 Pro 在美国托管上线,WANDR 得分 0.359,每任务成本 0.75 美元,比成本性能前沿便宜 62%。— 来源:1
- NVIDIA 开源 SkillEvaluator,测试表明添加技能可使 agent 正确性提升 41 点、有效性提升 39 点、效率提升 35 点。— 来源:1
- 开源生态迎来多个新工具:Miles v0.1 开源 RL 框架获广泛采用,Sentence Transformers v6 引入晚交互检索,MiniMax H3 无限量开放,NVIDIA 发布 RTX Spark。— 来源:1 2 3 4
一、AI 安全与前沿训练暂停
- OpenAI 宣布暂停计划部署最新模型的强化学习训练两周,以加固研究环境并扩大监控;最大规模的前沿 RL 训练仍保持暂停,待小规模训练与评估验证安全措施。Sam Altman 随后表示,模型进步极快,如果能力超出安全对齐速度就会采取行动,并呼吁领域协调安全标准,同时承诺在此期间单方面行动。— 来源:1 2
- Ethan Mollick 认为,OpenAI 愿意将 20% 的研究推理算力用于思维链监控,说明对齐问题已经相当严重,实验室之间需要通用的政策和标准。Greg Brockman 也转发了关于加强安全与监控而暂缓前沿训练规模扩大的消息,反映行业对安全风险的共同警觉。— 来源:1 2
二、模型与产品发布
- DeepSeek V4 Pro 在美国托管的 Perplexity Computer 上线,在 WANDR 评测中得分 0.359,每任务成本 0.75 美元,比成本性能前沿的下一个模型便宜 62%。该模型以低成本高性价比进入美国市场,可能加剧推理侧竞争。— 来源:1
- Runway 宣布 MiniMax H3 现已无限量使用,Max 计划用户可在限定时间内无上限生成视频。这大幅降低了视频生成的使用门槛,也展示了 Runway 对算力容量的信心。— 来源:1
- NVIDIA 发布 RTX Spark,将创意工作流、本地 AI 工具与 RTX 游戏整合到一台 PC。这标志着 AI 算力正在向工作站与个人创作设备下沉,为设计师和开发者提供本地化 AI 能力。— 来源:1
三、开源与开发工具
- Miles v0.1 发布,成为面向 LLM 和多模态模型的开源 RL 框架,旨在帮助调试、提高硬件效率并支持规模化 RL 训练。该项目已有 72 位贡献者、1326 次提交,并被多家前沿模型开发方采用,凸显开源社区在 RL 基础设施上的投入。— 来源:1
- Hugging Face 转发介绍 Sentence Transformers v6 发布,其核心是多向量嵌入(late-interaction)模型如 ColBERT,通过 MaxSim 实现细粒度语义匹配,优于传统 bi-encoder 向量检索。新版本新增训练/微调支持,且 Elastic、Qdrant 等向量数据库已支持,有望推动行业采用。— 来源:1
- NVIDIA 开源技能评估器 SkillEvaluator。其基准测试显示,在 300 多个已验证技能中,同一任务同一模型下添加技能可使 agent 正确性提升 41 点、有效性提升 39 点、效率提升 35 点,为 agent 技能工程提供了可量化评估工具。— 来源:1
四、AI 能力与行业观点
- Anthropic 的 Claude 成功从零设计新型蛋白质结合剂,在 15 个靶点中针对 14 个完成自主设计,并由 Adaptyv Bio 和 Twist Bioscience 独立构建测试。Yann LeCun 分析指出,Claude 的编排能力出色,但主要功劳应归于开源蛋白质设计工具(来自 Baker 实验室、Columbia、MIT、ByteDance Seed 等),且这些工具共享训练分布,存在共同盲区。— 来源:1 2
- Ethan Mollick 对“主权 AI”提出质疑,认为如果主权模型远落后于前沿,在差距最大的前沿应用(如网络安全)中使用滞后模型会有很大代价。这一观点挑战了各国建设独立 AI 算力的主流叙事。— 来源:1
- swyx 转发了 AI Engineer World's Fair 2026 生成式媒体 Track 的核心论点:生成式媒体的所有难点都发生在模型运行之前和之后。这一框架提示从业者将注意力从模型本身转向数据、工作流与分发环节。— 来源:1
