要点速览
- 智能体处理能力爆发:周级10B tokens成为常态。
- NVIDIA编码Agent满分通过ARC-AGI-3,并发布550B教师模型与PRISM动作模型。
- Ethan Mollick:Ox Alpha不及开放权重前沿,Kimi K3表现亮眼。
- AI研究新规:旧模型负面结论易过时,正面结论更持久;评估需以真实数据为锚。
- 中国“闪电”人形机器人百米9.32秒,马斯克警示美国落后。
- SpaceX年内实现100次回收,Starship加速星际运输。
一、AI模型、智能体与应用
智能体处理能力迎来量级跃升:Greg Brockman指出,不到一年前一年处理10B tokens已属重大成就,如今一周就能超过10B tokens。这意味着智能体规模化应用的成本门槛大幅降低,迭代速度进入新阶段。— 来源:1
NVIDIA发布多项AI基础设施成果:其自建编码harness优化CUDA内核,在 ARC-AGI-3 的25个公开游戏全部183关中取得100%成绩;同时发布550B指令跟随教师模型,在约束遵循、结构化输出和格式控制上表现突出,适合用于蒸馏与数据生成;还推出PRISM(1.4B)文本生成动作模型,可输出SMPL-X参数,便于部署。这些工具共同指向“人人可运行和优化AI模型”的方向。— 来源:1 2 3
Ethan Mollick早期测试显示,神秘模型Ox Alpha表现尚可,但在开放权重模型中并不处于前沿;相比之下,Kimi K3在他的新哥特城市着色器测试中表现很好,是出色的开放权重模型,但还达不到Sol Max或Fable的水平。这为开放权重模型的能力排序提供了新参考。— 来源:1
Ethan Mollick认为消费级AI被低估:医疗、政府事务、个人理财、学校表格等生活领域因复杂、设计缺陷或缺乏关照而难以处理,正是AI的价值所在。这一判断将AI的影响从开发者工具扩展到普通人的日常决策。— 来源:1
二、AI评估、研究方法与内容治理
Ethan Mollick针对使用旧模型(如GPT-4)做AI影响研究提出方法论:正面能力结论通常持久,因为AI获得的能力一般不会倒退;而“AI在某事上表现差”的负面结论需更谨慎。他建议直接声明“GPT-4无法做X”作为进度基准、对比各代模型能力趋势、论证结构局限或聚焦调节变量,避免做出易过时的负面主张。— 来源:1
Hamel Husain重申AI评估的基本原则:从真实数据出发,借助agent以有思考性的方式审视数据;自下而上的评估来自大量样本输出,AI不擅长凭空发明评估标准。当所有竞争者都能用Claude找出错误时,真正重要的是融入多少自己的品味。— 来源:1
Hamel Husain预告评估课程片段,介绍DocWriter的做法:不把历史写作全部塞进上下文,而是构建多智能体管线对用户写作做词汇、语法和话语分析,提取模式并让用户通过两段文字对比来确认或拒绝。这是一种可复用的个性化写作评估设计。— 来源:1
关于文本水印,Hamel Husain认为水印可能出现的结果是:人们用小型本地LLM等工具去除水印,反而导致写作质量变差;但他也希望这会促使人们真正编辑自己的文字,而非盲目洗稿。这提示水印在保护AI内容的同时可能带来质量副作用。— 来源:1
