欢迎光临
我们一直在努力

GPT-6 Astra刷新SOTA!阿里Qoder眼镜版上线,Muse Spark 1.3回馈数据省90% | 9月4日 AI日报

🎬 视频版直达:https://www.bilibili.com/video/av117210160828820/

💡 今日趋势速览:OpenAI发布GPT-6 Astra,刷新多项基准并支持代替用户操作电脑。阿里推出Qoder眼镜版,AI眼镜成为Agent交互入口。Muse Spark 1.3上线AI Gateway,回馈数据可省90%费用,Agent落地与成本大战同步升温。

🎯 今日要点

  • OpenAI 发布 GPT-6 Astra,多项基准成绩刷新 SOTA
  • 阿里推出 Qoder 眼镜版,首批接入千问与乐奇 AI 眼镜
  • Muse Spark 1.3 上线 AI Gateway,回馈数据省 90%

  • 📋 今日内容汇总

    🤖 AI动态

  • OpenAI 发布 GPT-6 Astra,多项基准成绩刷新 SOTA
  • 阿里推出 Qoder 眼镜版,首批接入千问与乐奇 AI 眼镜
  • Muse Spark 1.3 上线 AI Gateway,回馈数据省 90%
  • MBZUAI 发布 K2 Horizon 375B A23B 并公开训练代码
  • Runway 发布通用世界模型 GWM Worlds 2
  • OpenEvidence 发布医疗模型家族,即日起向认证临床医生开放
  • Qwen 发布统一驾驶视觉语言模型 Qwen-Drive-1.0-4B
  • Anthropic 探索用函数钩子扩展 Claude Code,未正式发布
  • Zite MCP 上线:把 Claude 订阅变成 AI 应用构建工具
  • 微软发布 MAI-Transcribe-2:411 倍实时速度转录
  • Cursor 为 Cloud Agents 接入 macOS 运行环境
  • Anthropic 开源 AI 电商 Agent 参考实现
  • DeepMind 发布 WeatherNext 3 天气预报模型
  • AntLingAGI 开源金融模型 Ling-3.0-flash-Fin
  • Hugging Face 宣布与 NVIDIA 携手,将保持独立中立平台定位
  • 🧪 芯片半导体

  • Intel 称 14A 工艺关键指标 D0 提前一年达标,进度超台积电
  • 🦾 机器人具身智能

  • 智元机器人开源 AGIBOT WORLD 2026 强化学习数据集
  • 📌 模型排行榜

  • Artificial Analysis AI 模型能力排行榜

  • 🤖 AI动态

    1. OpenAI 发布 GPT-6 Astra,多项基准成绩刷新 SOTA

    来源:原文 | OpenAI

    OpenAI发布GPT-6 Astra,称其能代替用户在电脑上完成各类任务,而且速度飞快。新模型多项基准刷新最优水平,Terminal-Bench Science达64.6%,FrontierMath Tier 4达97.6%在第三方智能指数与编码智能体指数中同样名列前茅,即日起向部分组织推出,未来几天扩展至Plus、Pro、Business与Enterprise用户及API。

    OpenAI 发布 GPT-6 Astra,多项基准成绩刷新 SOTA

    OpenAI 发布 GPT-6 Astra,多项基准成绩刷新 SOTA

    OpenAI 发布 GPT-6 Astra,多项基准成绩刷新 SOTA

    🔗 https://x.com/OpenAI/status/2095595741528125780


    2. 阿里推出 Qoder 眼镜版,首批接入千问与乐奇 AI 眼镜

    阿里为Qoder推出眼镜版,首批接入千问AI眼镜和乐奇AI眼镜。眼镜成为Qoder的语音与视觉入口,用户开口即可派任务,Agent在云端或电脑上执行,眼镜负责汇报进度、确认关键操作。此外,看到报错弹窗或设计稿,可让眼镜拍摄,Qoder复述确认无误后再继续排查修改。

    阿里推出 Qoder 眼镜版,首批接入千问与乐奇 AI 眼镜

    阿里推出 Qoder 眼镜版,首批接入千问与乐奇 AI 眼镜

    🔗 https://x.com/0xLogicrw/status/2095401820722192485


    3. Muse Spark 1.3 上线 AI Gateway,回馈数据省 90%

    来源:原文 | vercel_dev

    Muse Spark 1.3 已上线 Vercel AI Gateway:可按标准价格运行,若选择将训练数据回馈给 Meta,价格可便宜 90%。平台提供两个模型标识:meta/muse-spark-1.3 标准版与 meta/muse-spark-1.3-contributor 贡献者版。

    Muse Spark 1.3 上线 AI Gateway,回馈数据省 90%

    🔗 https://x.com/vercel_dev/status/2095277962144931895


    4. MBZUAI 发布 K2 Horizon 375B A23B 并公开训练代码

    来源:原文 | TestingCatalog (Twitter) | TestingCatalog (Twitter)

    阿联酋 MBZUAI 发布开放权重 MoE 模型 K2 Horizon 375B A23B(总参 375B、激活 23B),随模型公开训练代码、数据配方、中间检查点与评估结果,并放出 MoVA 专家路由与 Uno 扩散适配器两个组件。Artificial Analysis 智能指数得 47,智能体表现较前代提升 30 分。

    MBZUAI 发布 K2 Horizon 375B A23B 并公开训练代码

    MBZUAI 发布 K2 Horizon 375B A23B 并公开训练代码

    🔗 https://x.com/ArtificialAnlys/status/2095504796468056503


    5. Runway 发布通用世界模型 GWM Worlds 2

    来源:原文 | runwayml

    Runway 发布通用世界模型 GWM Worlds 2,可生成交互式实时模拟,输出连续 720p 视频、24 fps 与 48000 Hz 音频。模型构建于其基础视听生成模型之上,用户可定义世界的环境、主体、视觉风格、物理规则与氛围,并以文本指令操控主体或场景,世界随每次新输入延续。以下是官方给出的 demo

    Runway 发布通用世界模型 GWM Worlds 2

    🔗 https://x.com/runwayml/status/2095540014645920040


    6. OpenEvidence 发布医疗模型家族,即日起向认证临床医生开放

    来源:原文 | Max For AI (Twitter)

    OpenEvidence发布医疗AI模型家族,称其为迄今最强大,截至2026年各主流基准得分最高的医疗模型。Osler用于走廊快速问诊,Sackett用于正式会诊,Snow用于肿瘤病例讨论第四款Darwin在MedQA取得满分100%,对比Claude、GPT、Gemini等前沿模型四项医疗基准全面领先,目前处于研究预览阶段,仅限申请使用。

    OpenEvidence 发布医疗模型家族,即日起向认证临床医生开放

    OpenEvidence 发布医疗模型家族,即日起向认证临床医生开放

    🔗 https://x.com/OpenEvidence/status/2095531565699027266


    7. Qwen 发布统一驾驶视觉语言模型 Qwen-Drive-1.0-4B

    来源:原文 | Hugging Papers (Twitter)

    Qwen 在 Hugging Face 发布统一驾驶视觉语言模型 Qwen-Drive-1.0-4B,在单一框架内同时处理 3D 感知、视觉问答与运动规划三类任务。该模型保持基础 VLM 架构不变,并在 NAVSIM、Waymo 和 LingoQA 等基准测试上取得有竞争力的结果。

    Qwen 发布统一驾驶视觉语言模型 Qwen-Drive-1.0-4B

    🔗 https://x.com/HuggingPapers/status/2095357416950915380


    8. Anthropic 探索用函数钩子扩展 Claude Code,未正式发布

    Anthropic 正在探索一种扩展和自定义 Claude Code 的新方式:函数钩子(Function Hooks),并发布多个视频展示可实现的功能。该功能尚未正式发布,开发者可在其 GitHub issue 上提交反馈。

    Anthropic 探索用函数钩子扩展 Claude Code,未正式发布

    🔗 https://x.com/ClaudeDevs/status/2095572891941351550


    9. Zite MCP 上线:把 Claude 订阅变成 AI 应用构建工具

    Zite 宣布推出 MCP 服务,将用户的 Claude 订阅变成完整的 AI 应用构建工具:把 Claude、ChatGPT 或 Cursor 连接到 Zite MCP 后,直接描述想要的应用即可。应用上线后自带数据库、供全团队使用的登录系统以及区分权限的角色设置,且构建过程不消耗 Zite 积分。以下是官方给出的 demo

    Zite MCP 上线:把 Claude 订阅变成 AI 应用构建工具

    🔗 https://x.com/domwhyte42/status/2095512675996639300


    10. 微软发布 MAI-Transcribe-2:411 倍实时速度转录

    微软AI发布语音转录模型MAI-Transcribe-2,以2.0%的词错误率排名第2,约411倍实时速度同为第2,跻身准确性-速度帕累托前沿在基准榜单上,它仅次于阿里巴巴的1.7%,领先ElevenLabs Scribe v2的2.2%;定价每千分钟1.67美元不到同类一半,语言支持扩至60种。

    微软发布 MAI-Transcribe-2:411 倍实时速度转录

    微软发布 MAI-Transcribe-2:411 倍实时速度转录

    🔗 https://x.com/ArtificialAnlys/status/2095521214777442546


    11. Cursor 为 Cloud Agents 接入 macOS 运行环境

    Cursor 为 Cloud Agents 接入 Namespace Devboxes,运行 Agent 时可直接选择 macOS 环境。Namespace 会为每个会话临时启动一台 Apple M5 Mac,让 Agent 在真正的 macOS 上改代码、编译和跑测试,任务结束后该 DevBox 就被销毁。在此之前,Cursor 默认云端开发环境一直是 Ubuntu,无法完成 iOS 和 macOS 原生开发的完整构建,此番合作正好补齐这一短板。

    Cursor 为 Cloud Agents 接入 macOS 运行环境

    Cursor 为 Cloud Agents 接入 macOS 运行环境

    🔗 https://x.com/0xLogicrw/status/2095459538384330813


    12. Anthropic 开源 AI 电商 Agent 参考实现

    Anthropic开源了可运行的AI电商Agent参考实现官方称,使用Claude购物Agent的零售商购物车价值最高提升35%,消费者完成购买的可能性提高60%。该仓库包含购物Agent与商家Agent两类,共十项技能,并附三个Claude Code插件命令用于构建和评估Agent。以下是官方给出的 demo

    Anthropic 开源 AI 电商 Agent 参考实现

    Anthropic 开源 AI 电商 Agent 参考实现

    🔗 https://x.com/xiaohu/status/2095443122729984494


    13. DeepMind 发布 WeatherNext 3 天气预报模型

    Google DeepMind 称 WeatherNext 3 是全球天气预报方式的重大突破:该模型与 Google Research 联合开发,直接从真实世界的实时观测数据中学习,以更快速度提供更本地化、更精准的预测。

    DeepMind 发布 WeatherNext 3 天气预报模型

    🔗 https://x.com/GoogleDeepMind/status/2095528012791902536


    14. AntLingAGI 开源金融模型 Ling-3.0-flash-Fin

    AntLingAGI 宣布开源 Ling-3.0-flash-Fin 金融增强模型,面向真实工作流场景,同时开源 FinFIRST——一个由专家构建的金融搜索智能体基准测试;两项发布共同目标是让金融 AI 更易获取、更可验证。

    AntLingAGI 开源金融模型 Ling-3.0-flash-Fin

    🔗 https://x.com/AntLingAGI/status/2095533696808051001


    15. Hugging Face 宣布与 NVIDIA 携手,将保持独立中立平台定位

    Hugging Face 联合创始人 Julien Chaumond 宣布与 NVIDIA 携手。他表示 AI 正处关键拐点,开源 AI 可能被大型闭源实验室甩开,也可能成为下一阶段人类文明的基础设施;鉴于黄仁勋对开源 AI 的立场,NVIDIA 是其唯一真正考虑的合作伙伴,Hugging Face 将继续作为独立运营的中立平台。

    Hugging Face 宣布与 NVIDIA 携手,将保持独立中立平台定位

    🔗 https://x.com/julien_c/status/2095487938909876366


    🧪 芯片半导体

    16. Intel 称 14A 工艺关键指标 D0 提前一年达标,进度超台积电

    快科技9月3日消息,Intel CFO透露1.4nm节点14A工艺D0缺陷密度提前一年达标今年6月14A缺陷密度已达D0 0.5,目标2027年一季度做到D0 0.1-0.2这意味着Intel有望比台积电提前半年甚至3个季度进入1.4nm时代,此前18A仅算追平,此番有望实现赶超。

    Intel 称 14A 工艺关键指标 D0 提前一年达标,进度超台积电

    Intel 称 14A 工艺关键指标 D0 提前一年达标,进度超台积电

    Intel 称 14A 工艺关键指标 D0 提前一年达标,进度超台积电

    🔗 https://news.mydrivers.com/1/1148/1148562.htm


    🦾 机器人具身智能

    17. 智元机器人开源 AGIBOT WORLD 2026 强化学习数据集

    智元机器人开源 AGIBOT WORLD 2026 主题 3:强化学习,面向真实世界机器人学习的具身智能数据集。数据集含 14 项真实世界任务、11430 条轨迹,捕捉从示范到部署全过程的成功、失败与人工纠正,并提供针对进度、错误与干扰的细粒度标注与人在回路纠正轨迹。以下是官方给出的 demo

    智元机器人开源 AGIBOT WORLD 2026 强化学习数据集

    🔗 https://x.com/AGIBOTofficial/status/2095402214324072731


    📌 模型排行榜

    18. Artificial Analysis AI 模型能力排行榜

    最后是今日的 AI 模型能力排行榜单,智力榜Claude Fable 5.1以66分登顶,Claude Opus 5以63分居次,Muse Spark 1.3以62分第三。智能体榜Fable 5.1以61分领跑,Muse Spark 1.3与Claude Opus 5同以59分并列第二。开源GLM-5.3亮眼,居智能体榜第4名(59分)。

    Artificial Analysis AI 模型能力排行榜

    Artificial Analysis AI 模型能力排行榜

    🔗 https://artificialanalysis.ai/?intelligence=artificial-analysis-intelligence-index#intelligence-tabs

    以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。

    赞(0)
    未经允许不得转载:171主机测评 » GPT-6 Astra刷新SOTA!阿里Qoder眼镜版上线,Muse Spark 1.3回馈数据省90% | 9月4日 AI日报
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址