要点速览
- GLM 5.2 在多项基准中表现接近最佳闭源模型,部署成本高但有望替代 30-50% 企业工作负载。
- 代码协作模式扩展至知识工作面临根本矛盾:软件思维只重结果,而研究过程同等重要。
- AI 算力结构性短缺:独立实验室需 6 GW,实际仅 1.3 GW,缺口持续数年。
- ML 项目中评估和数据清洗占工作量 90%,模型训练仅 2%。
- 世界模型评估关键转向隐变量演化结构,机器人技术 JEPA 路线可规模化。
- 开源 AI 领导力转移:中国在 2024-2026 年领先,开源权重重生态加速竞争。
一、GLM 5.2:开源模型的新高度
- GLM 5.2 是首个在某些基准上不亚于最佳闭源模型的开源模型,部署成本高但若替代 30-50% 企业工作负载,可能颠覆企业 AI 成本市场。— 来源:1
- GLM 在金融基准测试通过率达 80%,而 DeepSeek v4 低于 5%。— 来源:1
- GLM 5.2 在两台联网 Blackwell tinybox 上以 120 tok/s 运行,约 150k 美元硬件方案可替代云服务。— 来源:1
- GLM 5.2 在 Vending Bench 排名第二,成本不到 Opus 一半。— 来源:1
- 开源 AI 生态系统(OpenWeightLand)多提供商竞争降低价格,可本地运行、微调。开源 AI 领导力在 2024-2026 年由中国领先。— 来源:1 2
二、AI 在科研与知识工作中的应用挑战
- GPT-5.5 Pro 能分析作者研究生论文并扩展论点,暴露 AI 与学术工作互动的奇怪方式。— 来源:1
- 将代码协作模式扩展到知识工作面临根本问题:软件思维只重视最终结果,而知识工作的过程(研究、探索、实验等)与结果同等重要。长期模型(如 Fable)需解决这一矛盾才能突破编码领域。— 来源:1
三、AI 基础设施与算力瓶颈
- AI 算力结构性短缺:独立实验室需 6 GW,目前仅拿到 1.3 GW,缺口持续数年。— 来源:1
- ML 项目实际分配:50% 评估,40% 数据清洗,2% 训练。评估和数据清洗决定噪声下限,需持续思考本体论并复审旧标签。— 来源:1
