要点速览
- Grok 4.5以1.5T参数实现比2.8T参数的Kimi K3便宜3倍,在编码任务中价值突出。
- GPT-5.6 Sol在网络安全领域达到新SOTA,能自主发现和修复漏洞,OpenAI还提供了100美元Codex credits奖励。
- NVIDIA Vera Rubin平台专为agentic后训练设计,Nemotron-3-Embed模型在LMEB和RTEB基准上排名第一。
- Runway Agent在独立AI视频代理排名中取得第一,在叙事连贯性、电影语言和制作质量上领先。
- OpenAI的Codex 5.6 Sol可编译游戏为原生应用,Ethan Mollick演示了通过Codex控制电脑生成3D动画。
一、模型与基础设施
- Elon Musk宣布Grok 4.5在速度、成本和性能上具有显著优势,其1.5T参数规模比Kimi K3的2.8T参数便宜3倍,实际使用中常超越其他前沿模型。— 来源:1 2
- Greg Brockman和OpenAI共同发布GPT-5.6 Sol在网络安全领域达到最先进水平,能帮助团队在真实代码中发现、验证并修复漏洞,相关能力已转化为防御成果;OpenAI还发起活动,前1万名参与者可获得100美元Codex credits。— 来源:1 2 3
- Greg Brockman还指出Sol模型能自主坚持完成任务,不再依赖OpenAI的/goal功能;此外,Terra版本(5.6 Terra high)比5.5速度快约40%且质量损失极小,成本大幅降低。— 来源:1 2
- Ethan Mollick肯定Kimi K3性能不亚于Q1 2026最公开模型,但对其虚构内容偏好(沉没城市、古代末日等)和开源权重策略提出批判,认为开源可能减速AI发展并导向“AI共产主义”。— 来源:1 2
- NVIDIA发布Vera Rubin平台,专为agentic后训练设计,通过极致协同降低每次推理的token成本;同时NVIDIA AI发布Nemotron-3-Embed 8B模型,在LMEB和RTEB基准上排名第一,支持Blackwell NVFP4和高吞吐量。— 来源:1 2 3
二、产品与应用
- Runway的Agent在独立AI视频代理人类评估中排名第一,在叙事连贯性、电影语言和制作质量三个维度均领先,尤其在主观指标上优势明显。— 来源:1
- Elon Musk宣布Grok TTS在人类语音指数中得分94(接近人类),延迟460毫秒,成本仅15美元,比竞争对手Eleven v3便宜近7倍且音质更好;Grok Build新增/timeline命令和语音输入功能。— 来源:1 2
- Ethan Mollick演示了Codex通过计算机控制下载安装Blender并生成3D动画,仅需一次授权;他还关注到使用Codex 5.6 Sol将RollerCoaster Tycoon 2编译为原生iPad应用,支持触摸控制。— 来源:1 2
- NVIDIA AI发布ARDY,展示AI动画的实时、开源方向,用户可在Hugging Face Spaces上通过文本指令快速生成角色动作序列。— 来源:1
