🤖 AI 大模型日报
日期:2026年9月3日(星期四)
本报告基于公开网络资讯整理,覆盖 GPT / Claude / Gemini / Llama / DeepSeek 等主流模型最新动态与行业趋势。
📌 今日热门话题摘要
| 1 | Google 发布 Gemini 3.8 Flash / 3.8 Flash Cyber | 距上次发布仅 3 周再度上新;WSJ 称新模型编码能力大幅升级、显著缩小与领先者的差距;官方定位为"迄今最智能的 Flash 模型",面向长程软件工程、自主智能体与复杂企业工作流,Cyber 版本主打网络防御场景 |
| 2 | Anthropic 加入 AI 价格战 | Fable 5.1 缓存读取价格从 $1.00 降至 $0.25(降幅 75%,仅为正常输入价 $10 的 2.5%),高 Agent 负载场景成本最高可降约 45%;9 月 1 日 GA,定价 $10/$50 不变 |
| 3 | OpenAI 生态全球化扩张 | GPT-5.6 家族(Sol / Terra / Luna)上线 Amazon Bedrock,澳大利亚团队可通过悉尼/墨尔本区域"全球跨区域推理"访问;GPT-5.3 Instant 开始作为 ChatGPT 默认日常模型推送(9/1) |
| 4 | 算力需求侧持续火爆 | 黄仁勋在 G20 部长会议上敦促各国加建数据中心,警告"只谈风险不建基础设施"的危险;HPE Q3 营收同比 +34% 至 $122 亿、新签 $35 亿服务器大单,但因供应约束无法完全满足需求 |
| 5 | Agent 并购与安全议题升温 | Palo Alto Networks 以约 $5 亿(现金+股票)收购智能体 IT 支持初创 Console(此前估值仅 $1.57 亿);“前沿 AI 研究加速转向网络防御”,平台大厂内部出现"网络超级智能实验室" |
| 6 | 编码能力竞赛进入周级迭代 | WSJ 报道 Gemini 3.8 Flash 直指编码赛道;Anthropic Fable 5.1 自报 Terminal-Bench-Science 52.6(Fable 5 仅 24.7);OpenAI GPT-5.3-Codex(快 25%)与 Cerebras 合作版 Spark 相继发力 |
🚀 各重要模型动态
OpenAI(GPT 系列)
- GPT-5.6 家族(Sol / Terra / Luna)上云扩张:9 月 2 日起澳大利亚团队可在 Amazon Bedrock 上通过亚太(悉尼/墨尔本)区域的全球跨区域推理访问 GPT-5.6 系列模型,OpenAI 模型的企业触达面进一步扩大。
- GPT-5.3 Instant 成为 ChatGPT 默认日常模型(9/1 起滚动推送):OpenAI 官方称新版改进了回复语气、减少"卖关子式"表述,主打日常场景的准确性。
- GPT-5.3-Codex:号称迄今最强的 agentic 编程模型,推理与专业知识能力提升,运行速度较前代快约 25%;与 Cerebras 合作的 GPT-5.3-Codex-Spark(超快实时模型)继续在低延迟编程赛道推进。
- 家族其他成员:GPT-5.3(旗舰)、gpt-oss(开源)、GPT-Live-1(实时语音)等。
Anthropic(Claude 系列)
- Claude Fable 5.1(9/1 GA,9/2 起被媒体定性为"加入价格战"):定价维持 $10/$50 每百万 token,但缓存读取降至 $0.25(较 Fable 5 的 $1.00 降 75%,仅为输入价的 2.5%),长上下文与多轮 Agent 负载成本显著下降;自报 Terminal-Bench-Science 52.6(Fable 5 为 24.7)。
- Claude Mythos 5.1:面向网络防御者与生命科学家的"可信访问"(trusted-access)孪生版本,体现前沿能力分级管控思路。
- 生态与争议:Auto Mode(免托管智能体)、Model Hardware Standard(8/31,让智能体操作显微镜/机械臂等物理设备)持续推进;9/1 有分析指出 Anthropic R&D 节奏放缓,业界围绕 AI 智能体安全展开讨论。
- 家族其他成员:Claude Opus 5($7/$36)、Opus 4.5(编码登顶 SWE-bench 80.9% 的上一代标杆)等。
Google(Gemini / Gemma 系列)
- Gemini 3.8 Flash / Gemini 3.8 Flash Cyber(9/2-3,头条发布):与上次发布仅隔约 3 周,迭代明显提速。两大模型基于同一技术底座;WSJ 消息称其编码能力显著升级,“缩小与对手的差距”;官方称其为"最智能的 Flash 模型",专为长时程软件工程、自主智能体与企业复杂工作流设计,推理(reasoning)能力大幅增强。已向 Glean 客户提供持续推理能力。Cyber 版本面向安全运营场景,与行业"AI 进防守"浪潮呼应。
- 上半年脉络回顾:Gemini 3.1 Pro(2/19,主打企业市场)、Gemini 3.7 Flash(8/13)、Gemini Omni 1.1 Flash(8/27)、Gemini 3.5 Transcribe(8/26)、Gemini-SQL2(数据库专用);开源侧 Gemma 4 家族(4/3)持续加码;视频侧 Veo 3.1、Omni Flash 系列齐头并进。
Meta(Llama / Muse 系列)
- 开源路线摇摆引发关注:The New Stack(8/19)报道 Meta 正从开源 Llama 转向闭源 Muse Spark,社区以 Llama 分叉填补缺口;而 Axios(4/6)曾披露 Meta 计划开源下一代模型以追赶对手。两条消息并存,反映 Meta 开源/闭源策略仍在动态调整。
- 近期模型以 Muse 品牌推进:Muse Spark 1.2(8/5,闭源)、Muse Glimmer-30B(8/10,精选开源推理模型)等;此前 Llama 4(Scout/Maverick,MoE 原生多模态)已为开源生态奠定基础。
DeepSeek(V4 系列)🔥
- DeepSeek-V4-Pro 正式版(8/13):1.6T 参数 MoE 架构,百万上下文普惠,Agent 能力大幅强化;同步适配 OpenAI Responses API 格式与 Codex。
- 定价创新:峰谷定价 8/17 生效(闲时半价),为行业首创。
- DeepSeek-V4-Flash-Vision-Exp(8/21):多模态视觉理解实验版上线 API(model=deepseek-v4-flash-vision-exp)。
- V4 预览版 4/24 发布即开源,是国产模型"高性能+低成本"路线的代表性力量。
国内其他主力(Qwen / GLM / Kimi / 混元 / 字节)
- 阿里 Qwen:Qwen3.8-Flash-Next(8/26,Qwen4 架构开源预览:6B 激活、262K 原生上下文,自报 DeepSWE 58.7);视频侧 Wan 3.0 / 2.7、图像侧 HappyHorse 等密集迭代。
- 智谱 GLM:GLM-5.3-Flash(8/26,首个原生多模态 GLM-5:320B/18B、1M 上下文、MIT 权重、列表价 $0.15/$0.50,自报 DeepSWE 63.4),性价比路线激进。
- 月之暗面 Kimi:据 AI Business(5/8)报道,Kimi 开发商 Beijing Lab 估值达 200 亿美元,全球投资者目光转向中国 AI;近期模型 Kimi K3(7/16,开源推理)等持续迭代。
- 腾讯混元:Hy4 preview(8/28,推理大模型)。
- 其他:字节 Seedance 2.5 / Seedream 5.0 Lite / 豆包、快手 Kling 3.0、MiniMax M3 / H3、小米 MiMo、阶跃 Step 3.7 Flash 等。
其他国际厂商
- xAI(Grok):Grok Imagine 系列(Image 2.0 / Video 1.5 / TTS v1)拓展多模态生成;Grok 4.6 于 8 月上新。
- Mistral:Magistral Small/Medium 推理模型 + 文本转语音模型(3/27);Cohere 发布边缘设备开源语音模型与轻量多语言模型(2-3 月)。
- Amazon Nova、NVIDIA Nemotron 3 Ultra、拉美开源项目 Latam-GPT(2/12)等亦在推进。
📈 行业趋势分析
发布节奏进入"周级迭代",编码与 Agent 是主战场:Google 距上次模型发布仅 3 周再推 Gemini 3.8 Flash,且直指编码与长程软件工程;OpenAI、Anthropic、Google 三家在编程智能体(Codex / Code / Gemini 3.8)上的竞争已白热化,WSJ 等主流财经媒体开始用"缩小编码差距"来描述竞争格局。
价格战从"表价"打到"成本结构":Fable 5.1 缓存读取降 75%($1.00→$0.25)被视为 Anthropic 加入价格战的标志;叠加 GPT-5.6 Sol 降价 20%+、GLM-5.3-Flash 低至 $0.15、DeepSeek 峰谷定价,缓存机制、思考强度档位、闲时折扣等"成本工程"创新成为新竞争维度。
Agentic AI 进入并购整合期:Palo Alto Networks 以约 3 倍于最新估值的价格($5 亿 vs $1.57 亿)收购智能体 IT 支持初创 Console;此前 Cognition 估值已达约 $470 亿。AI 客服/IT 自动化/编程智能体的头部效应与整合窗口同时打开。
算力军备竞赛与供应约束并存:黄仁勋 G20 游说加建数据中心;HPE Q3 营收 +34% 仍受供应限制、签下 $35 亿服务器大单——需求端由大模型训练与推理双轮驱动,供给端(GPU、电力、数据中心)仍是瓶颈,"AI 基建"成为国家层面议题。
AI 安全从"防御讨论"走向"产品与组织落地":Gemini 3.8 Flash Cyber、Claude Mythos 5.1(可信访问)接连出现,平台大厂内部设立"网络超级智能实验室",OpenAI/Anthropic/Google 此前联合呼吁将网络安全列为首要优先级——"进攻型 AI 加速,防守型 AI 必须同步进化"已成共识。
开源与闭源双轨并行,中国力量持续上分:Qwen4 架构开源预览、GLM MIT 权重、DeepSeek 全系开源,Meta 的 Llama→Muse 摇摆引发"开源缺口由分叉填补"的讨论;与此同时中国实验室(DeepSeek/阿里/智谱/月之暗面/腾讯)保持高密度上新,北京 AI 实验室估值达 $20B,全球资本加速布局中国 AI。
评测基准加速"真实任务化":Terminal-Bench-Science、DeepSWE、SWE-Pro 等 agentic/真实场景基准取代传统 SWE-bench 成为宣传主阵地(Fable 5.1 的 52.6 vs 24.7、GLM-5.3-Flash 的 63.4 等均为自报数据),第三方实测与厂商自报的对照将越来越重要。
🔗 主要信息来源
- LLM Stats 新闻聚合(llm-stats.com/ai-news,9/2-3 更新)
- AI Business(aibusiness.com):Anthropic Joins AI Price War / Language Models 频道
- WSJ:New Google AI Model Said to Narrow Gap on Coding Ability(9/2)
- Google DeepMind 与 Gemini API 官方文档(Gemini 3.8 Flash)
- Anthropic 官方(Claude Fable 定价页)与 Reddit/Newsquawk 发布信息
- VentureBeat:Fable 5.1 / Mythos 5.1 缓存降价报道
- OpenAI 官方模型发布说明与 EdTech Innovation Hub 报道(GPT-5.3 Instant 推送)
- DeepSeek 官方 API 更新日志(V4-Pro / V4-Flash-Vision-Exp)
- The New Stack(Meta Muse Spark)、Axios(Meta 开源计划)、Techmeme / Bloomberg 转载
本报告由 Hermes Agent 自动整理,仅供参考。


