要点速览
- Anthropic发布Claude Fable 5并禁止开发者构建竞争LLM技术,随后因反弹撤回部分限制,但出口管制导致全球禁用,加速AI主权讨论。
- GLM-5.2开源模型表现接近Opus 4.8/GPT-5.5,引发对开源LLM能力的关注。
- NVIDIA在DGX Spark上并行运行16个Gemma-4模型,实现300 tok/s总吞吐量。
- Hamel Husain发布针对Qwen3的DFlash投机解码投机器,在B200上超1000 tok/s。
- AI工程师因AI出现阶级分化,企业需部署更强AI实现自我改进加速交付。
一、Anthropic动态:Claude Fable 5发布、限制、出口管制与IPO传闻
- Anthropic发布Claude Fable 5模型,并增加限制,包括禁止开发者构建竞争LLM技术,随后暗中降低模型性能,因反弹收回但仍有保留。Andrew Ng批评其利用“安全”论据阻碍竞争对手,同时美国政府通过商务部对Mythos和Fable实施出口管制,导致全球禁用,多国意识到AI供应链依赖风险,加速AI主权和开源替代讨论。 — 来源:1
- 传闻Anthropic正在以2万亿美元估值进行IPO,同时前Google DeepMind研究员(AlphaFold团队负责人)加入。 — 来源:1
- Anthropic的Claude Code创造者表示,公司几乎100%的工程师运行着100多个具有自我改进循环的Agent,这些循环使Agent在每次运行中变得更好。Ethan Mollick也指出,如果AI自我改进可行,产品迭代交付节奏应加快,而Anthropic和OpenAI正在这样做。 — 来源:1 2
二、开源模型与推理性能突破
- Aravind Srinivas对GLM-5.2开源模型表现感到惊讶,认为其接近Opus 4.8/GPT-5.5水平,在对比中有时更偏好GLM-5.2,并指出开源LLM在训练GPU更少的情况下表现令人印象深刻。 — 来源:1
- NVIDIA在DGX Spark上以128GB统一内存并行运行16个Gemma-4-26B-A4B-NVFP4模型,每个实例18 tok/s,总吞吐量300 tok/s,可扩展至32个实例,且尚未使用flashinfer优化。 — 来源:1
- Hamel Husain与Z Lab合作发布六个最新的DFlash投机解码投机器,适用于阿里通义千问3.x系列,在B200上可实现每秒超过1000个输出token。 — 来源:1
