要点速览
- Grok 4.5在FrontierSWE和Long-Horizon Terminal-Bench等基准测试中排名前列,性能超越Claude Opus和GPT系列,成本更低,支持长期复杂工程任务。
- GPT-5.6 Sol增长迅速,Codex和ChatGPT Work活跃用户达800万,取消5小时速率限制,明天将发布更多更新。
- Elon Musk宣布X代码库将在安全审查后开源,并邀请第三方审查验证。
- Perplexity开源WANDR基准测试,用于衡量深度和广度研究能力,包含500个真实知识任务。
- Starlink V5终端发布,体积缩小48%、重量减轻62%,速度375+Mbps,美国设计制造。
- Yann LeCun批评美国芯片出口管制,认为会刺激中国芯片崛起,强调开源AI最终胜出。
一、AI模型竞争白热化
- Grok 4.5在FrontierSWE、Long-Horizon Terminal-Bench等基准测试中排名前列,性能超越Claude Opus和GPT系列,具备低成本、快速处理长期复杂工程任务的能力,并新增Stripe和Calendly连接器,成为工作流操作系统。— 来源:1 2 3 4 5 6
- GPT-5.6 Sol增长迅猛,推理团队支撑需求,Codex和ChatGPT Work活跃用户达到800万,重置所有使用限制,并继续取消5小时速率限制,鼓励用户探索能力边界。— 来源:1 2
- Perplexity开源WANDR基准测试,用于衡量深度和广度研究能力,包含500个基于真实知识工作的任务,即使最强模型也难以应对,而Perplexity的Search as Code架构能有效解决。— 来源:1 2
- Hugging Face发布多项模型进展:OvisOCR2在OmniDocBench上达96.58分,首个击败管线系统的端到端模型;Bonsai 27B通过1-bit量化从54GB压缩至3.9GB(-93%),仍保留90%性能,可在手机或浏览器本地运行;NVIDIA ARDY实现实时AI动画,输入文字生成角色动作序列。— 来源:1 2 3 4
- Yann LeCun介绍VISReg,首个基于正则化的自监督学习方法,在域外泛化性能上超越MoCov3、DINO、MAE、DINOv2等方法,达到SOTA。— 来源:1
二、开源与行业生态
- Elon Musk宣布X代码库开源,在完成安全审查后开源整个X代码库,并邀请第三方审查以确认运行的代码与开源一致。— 来源:1
- Yann LeCun呼吁开源AI,严厉批评美国芯片出口管制政策,认为自毁美国市场主导地位,反而刺激中国芯片崛起;赞同未来12个月内90%的token将流向开放模型的预测,强调开放最终会胜利。— 来源:1 2
- swyx总结AI工程五大趋势:焦点从智能体转向系统、循环工程成为新控制层、AI工程进入企业、编码智能体取代IDE、智能体平台围绕技能构建。— 来源:1
- Deedy列出22家AI初创营收运行率超5亿美元,包括Cursor(40亿美元)、Scale(20亿美元)等,反映AI创业公司商业化加速。— 来源:1
