要点速览
- Claude Fable 5展现全栈能力:一天迁移5000万行代码,绘制复杂3D图形,性能超越GPT 5.5且价格更低,已面向Pro和Max用户开放。— 来源:1 2
- NVIDIA与Trajectory Labs后训练Nemotron 3 Ultra在法律基准上实现通过率从0%到5.8%,持保留任务通过率提升至95%,成本仅为同级模型的1/8至1/50。— 来源:1
- Google DeepMind发布DiffusionGemma,并行生成256 token,速度比Gemma 4快4倍,NVIDIA提供全栈支持。— 来源:1 2
- xAI Grok Voice在EVA-Bench达帕累托前沿,价格远低于竞争系统;Grok Build插件市场进入Beta。— 来源:1 2
- Anthropic CEO发文呼吁加速AI政策制定,并启动Claude Corps奖学金培训1000人。— 来源:1 2
- PoeticHQ获5000万美元融资,准确率99%+;Runway与狮门影业合作开发原创IP。— 来源:1 2
一、模型与性能突破
- Claude Fable 5在Computer中面向Pro和Max用户开放(1)。据实测,该模型一天内从Stripe迁移5000万行代码(人类需2个月),绘制复杂3D图形(如Boeing 747、超过5000个物体的太空模拟),优化交互网络评估器性能10倍于GPT 5.5,且价格与GPT 5.5相近,比GPT 5.5 Pro便宜6倍(2)。此外,其在生成文档、幻灯片、网站等像素级完美内容方面被认为是自o3以来AI质量的最大进步,包括生成McKinsey风格报告、SpaceX IPO草案、像素级还原Pokemon游戏等(3)。
- NVIDIA与Trajectory Labs合作后训练的Nemotron 3 Ultra在法律领域达到前沿性能。在Legal Agent Benchmark上,全部通过率从0%提升至5.8%,介于Sonnet 4.6(4.2%)和Opus 4.6(6.6%)之间;持保留任务通过率从约70%提升至约95%,运行成本仅为Sonnet 4.6和Opus 4.6的1/8到1/50(1)。
- Google DeepMind发布DiffusionGemma,一种文本扩散模型,每步并行生成256个token,在DGX Spark上达到150+ TPS,单张H100上达1000+ TPS。速度比Gemma 4模型快4倍(1)。NVIDIA从首日起提供BF16和NVFP4 checkpoint、免费GPU加速端点以及FP8精度的vLLM支持(2)。
- xAI的Grok Voice在EVA-Bench评估中达到帕累托前沿,准确率和用户体验均优于同级系统,且价格远低于竞争对手。同时,Grok Build插件市场进入Beta版,支持从终端使用MongoDB、Vercel、Sentry等插件进行开发(1 2)。
- PoeticHQ——一个执行复杂多步骤任务的AI系统,准确率99%以上,令牌消耗比代理少10倍,已获5000万美元融资,应用于AIG、SoFi、Chime等企业(1)。
二、行业合作与商业动态
- Anthropic CEO Dario Amodei发布新文章《Policy on the AI Exponential》,指出AI发展远超政策制定流程,并推出三项新倡议以缩小差距(1)。同时启动Claude Corps全国奖学金项目,为早期职业人员匹配美国非营利组织,培训1000人使用Claude并支付报酬以推动其使命(2)。
- Runway与狮门影业深化合作,包括联合开发原创IP;2026年Runway AI电影节纽约首映门票已售罄(1 2)。
- xAI的模型被用于eToro的Agent Tori,结合实时数据帮助消费者分析市场情绪(1)。
- NVIDIA与Gcore和Orange Business合作,使用NVIDIA Dynamo实现大规模分布式AI推理(1)。此外,NVIDIA Vera CPUs将变革金融服务业,NYSE正利用Vera CPU加速扩展容量并优化延迟,构建高性能、弹性且AI就绪的市场基础设施(2)。NVIDIA还获得OpenAI颁发的Industry AI Acceleration Award(3)。
三、关键观点与争议
- Yann LeCun强烈批评以“安全”为名的审查模型,强调开源必须赢得模型和接口层,否则封闭源码将导致监控经济。他讽刺苹果、Gmail、特斯拉等以安全名义限制竞争的行为,并批评Anthropic悄悄降低Claude性能,认为这种不透明干预伤害独立研究人员和初创企业(1 2 3)。他还提出AGI是生物幻觉,应转向超级适应智能(SAI),专注于极端专业化(4)。
- Ethan Mollick提出“换更便宜的模型省钱”是误区,更优做法是采用层级模型架构,用智能模型协调和审计廉价模型(1)。他认为Anthropic对Mythos级模型的滥用有真实担忧并设置了过度防护,但未能成功向外界解释和说服人们(2)。他对Anthropic回滚Fable防护栏政策表示赞同(3)。
- swyx引用Sarah Guo的“模型实验室vs代理实验室”框架,认为这是理解当前AI价值实际所在的最清晰方式之一(1 2)。他还记录了Satya Nadella对微软AI战略的重新定义:从单一模型转向生态系统,强调评估作为IP、代理痕迹可成为资产负债表资产,以及行业需要赢得社区信任才能继续扩建数据中心(3)。
