要点速览
- OpenAI自研推理芯片Jalapeño测试结果公布,宣称每瓦算力提升、响应更快、延迟更低,Sam Altman确认“造了一颗芯片”。
- NVIDIA Vera Rubin NVL72生产机架到位,全自动化制造,微软率先部署、富士康投产;Dynamo故障恢复与Jetson Orin Nano 2同步亮相。
- ChatGPT Work新增代登录能力,可安全处理预约、报销等事务;商务席位100美元/月上线,定时任务功能升级。
- Perplexity发布本地优先代理Portable Computer(27B模型得分82.6%),并与NVIDIA合作支持DGX Spark;后台Dream agent与Brain记忆系统评测显著提升。
- Hugging Face发布GLM-5.3-Flash(MIT开源,320B-A18B,运行于中国AI芯片),并预告Qwen3.8 Flash。
一、AI 芯片与算力基础设施
- OpenAI自研推理芯片Jalapeño测试结果公布:在保持效率的同时,实现每瓦算力提升、响应更快、吞吐量更高且延迟更低。OpenAI官方发布测试数据,CEO Sam Altman补充称“我们造了一颗芯片,而且速度很快”,显示OpenAI正通过自研芯片优化推理成本与性能。— 来源:1 2
- NVIDIA Vera Rubin NVL72生产机架已到位,采用全自动化制造,每分钟可组装一个托盘;微软率先部署、富士康产线正式投产,标志新一代AI计算平台进入量产。在Hot Chips 2026上,NVIDIA展示Vera CPU、Vera Rubin、Groq 3 LPX、Spectrum-X Multiplane、BlueField-4 Scale-In等组件,构成面向智能体工作负载的全栈AI平台。— 来源:1 2
- NVIDIA Dynamo推出Shadow engine recovery预览:LLM引擎崩溃时通过保持已启动的备用引擎接替,避免冷重启带来的容量损失;在GLM-5.2测试中恢复容量用时7.3秒,比冷重启快近39倍,显著降低推理中断影响。— 来源:1
- NVIDIA Jetson Orin Nano 2发布:面向入门级边缘AI机器人,推理性能是Jetson Orin Nano Super的2倍,15W模式下同等性能功耗降低40%,尺寸保持不变,进一步降低边缘部署门槛。— 来源:1
二、AI 代理与自动化产品
- ChatGPT Work新增“代登录”能力:AI可在不接触用户名和密码的情况下,替用户在网页和移动端登录网站,完成开户、预约、报销、租房、比价等日常事务。OpenAI、Sam Altman、Greg Brockman同步发布,强调全程不接触用户凭证,兼顾安全与便利。— 来源:1 2 3
- OpenAI推出ChatGPT Business Premium Seats:以每席位100美元的价格面向小企业和初创公司,提供更强大工具与高效工作流;Greg Brockman补充称取消5小时限制并提供更多用量,被官方评价为“改变游戏规则”。— 来源:1 2
- ChatGPT定时任务更新:Plus和Pro用户可设置由Slack、Gmail、GitHub变动触发的任务;Free用户也能创建最多三个定时任务,并支持分享任务,扩大自动化覆盖场景。— 来源:1
- OpenAI发布WebMCP:一种面向代理与人类通过UI协作的新协议(与MCP/API不同,直接暴露在浏览器中),配套开源的markdown notebook,支持自带编码代理,适合共同编辑notebook等场景。— 来源:1
- Perplexity发布Portable Computer研究:定位本地优先的私密、低成本代理,设备端27B模型在真实知识任务上得分82.6%,超越开源harness Pi和Hermes;后训练的PPLX 27B达到85.4%。Perplexity与NVIDIA合作,在DGX Spark上支持该研究,并推动低成本开放权重模型、推理框架和统一内存硬件生态。同时,Perplexity Computer为Max用户提供后台Dream agent,持续从文件和连接应用摄取上下文并构建多跳上下文图;Brain记忆系统将会话、文件和来源整理为结构化知识wiki,新评测中正确性提高9.3点、时效性提高8.0、召回提高8.9,token消耗减少15%。— 来源:1 2 3 4
- Andrew Ng发布开源AI代理OpenWorker新版本:不仅能聊天,还能在用户电脑上完成实际任务,新增多项面向安全workflow的功能,内置代码漏洞、依赖供应链注入、云安全配置等网络安全代理。框架完全开源,支持本地运行开放权重模型以保护敏感代码,也可接入ChatGPT订阅、Ox Alpha等模型,避免封闭模型对合法安全工作的拒绝。— 来源:1
- swyx警告:暂时不要使用codex的“locked use”功能,该功能依赖不稳定的Mac特性,已导致本人两次被锁出macOS钥匙串,Apple开发者论坛已确认这是已知bug;云端方案虽好但尚未成熟。— 来源:1
三、开源模型与生态
- Hugging Face发布GLM-5.3-Flash:性能领先且价格有竞争力,具备原生多模态、1M token上下文,320B-A18B参数,以MIT许可开源,并完全运行在中国AI芯片上,代表国产芯片+开源模型协同的重要进展。— 来源:1
- Hugging Face推出Apodex 1.1模型系列:具备前沿级代理智能,支持异步代理团队协作,并开源FrontierAgent研究工具,降低多智能体系统研究门槛。— 来源:1
- Hugging Face预告Qwen3.8 Flash将在22小时后发布,强调本地AI热度高;同时推荐排名第一的开源权重TTS模型Breeze TTS 2,支持语音设计、语音参考和语音方向。— 来源:1 2
- Hugging Face将《大英百科全书》第1至14版共115,293页插图数据集上传至Hub,为多模态研究和历史文档数字化提供大规模资源。— 来源:1
四、行业动态与观点
- Ethan Mollick指出,OpenAI曾在2025年10月将某种方式宣布为企业AI代理的未来,但Agent Builder已于6月被停用,不过仍有许多企业产品沿用这一模式,暗示企业代理策略仍在调整。他还提醒教师,过去6个月AI能力大幅提升、错误率显著下降、在学生中普及近乎全面,需要及时更新认知。— 来源:1 2
- Runway AI Summit将于今年9月在旧金山举办,邀请机器人、自动驾驶、营销和基础设施等领域领袖,探讨AI如何重塑智能与世界的交互方式,现已开放注册。— 来源:1
- swyx作为Restate成员,对Restate为Replit的agents提供durable execution支持表示自豪,认为其规模和架构复杂度令人惊叹,体现Agent后端基础设施在真实产品中的规模应用。— 来源:1
