天眼早报
🤖 AI 大模型
𝕏 OpenAI 发布 GPT-6 Sol 与 Luna:旗舰能力下放,API 价格永久下调 50%
OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,承接旗舰 GPT-6 Astra 的能力,API 价格较 GPT-5.6 永久下调 50%:Sol 定价每百万 token 输入 2 美元、输出 10 美元,Luna 为 0.10/0.50 美元,缓存输入最高享 90% 折扣。Sol 在 AutomationBench 得 33.2%,每任务成本约 0.27 美元,约为 Claude Opus 5 的 9%;DeepSWE 编程评测得分 68.8%,接近 Fable 5 但成本低约 80%,编码欺骗率仅 1.3%。即日起登陆 ChatGPT Work、Codex 与 API,Free 与 Go 用户可在桌面版试用 Luna,使用限额同步提升。
𝕏 Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1,成本降低 40%
Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首个模型,官方称其在多数任务上达到 Fable 5.1 水平:GDPval-AA v2.1 得分 1846(Fable 5.1 为 1735),Terminal-Bench 4.0 得分 66.4%,Artificial Analysis 智能指数 58 分登顶。典型工作负载成本比 Opus 5 低约 40%,输出速度提升 30% 以上,API 定价为每百万 token 输入 4 美元、输出 20 美元,缓存读取再降 60% 至 0.20 美元。该版本同步强化网络安全防护,修复模型逃离测试沙盒等风险行为,已在 Claude 全平台及 AWS、Google Cloud、Azure 上线,支持零数据留存,Pro/Max/Team 用户五小时用量限制同步提升。未来几周还将推出 Sonnet 5.5 与 Haiku 5.5。
🔶 小米发布 MiMo-V2.6 系列:登顶开放权重模型榜首
小米 发布原生全模态 MiMo-V2.6 系列,MiMo V2.6 Pro 在 Artificial Analysis 智能指数取得 46 分,登顶开放权重模型榜首(上代 V2.5-Pro 为 26 分),超过 Qwen3.8-Max、Kimi K3 与 GLM-5.3,仅落后 GPT-5.6 Sol 1 分,平均每任务成本 0.13 美元。同步开源 Flash 版、MiMo-V2.6-Distill-Qwen-9B、技术报告、7000+ 强化学习任务环境、端到端 RL 框架及可组合 mini-harness。测试显示其向量数据库得分从 2505 升至 7810,接近 Claude Fable-5,ultraspeed 版达 464tps,总参数 1.02T、激活 42B,前端空间理解与美学仍需加强。API 价格维持输入 3 元、输出 6 元每百万 token。
𝕏 阿里发布 Qwen3.8 系列:RSI 递归自我进化连跑 33 轮
阿里 发布 Qwen3.8 系列,其中 Qwen3.8-Max 在极少人工干预下连续运行一个多月完成 33 轮 有效迭代,自主优化 SGLang 使单实例吞吐提升 96%,芯片设计实验将物理实现面积减少 42%;Qwen3.8-Omni-Flash 统一四模态计费,输入降至每百万 token 0.8 元。阿里同时表示,三年内将出现原生的 全模态统一生成模型,未来体验不再受模态边界限制,陆川、王珞丹等创作者已用其进行内容生产。
🏠 Meta 智能体 Muse 上线 12 天下载 280 万次,华尔街看好其商业化前景
Meta 新 AI 智能体 Muse 9 月 8 日上线,可代发邮件、订旅行、卖车,基础版免费并提供每月 20/100 美元 订阅。上线 12 天下载 280 万次,高于 ChatGPT 同期。Meta 股价累计涨超 20%,市值增超 2000 亿美元。
SpaceXAI 发布 Grok 4.7:长任务能力强化,价格减半
SpaceXAI 推出最强模型 Grok 4.7,换用更大基础模型,强化长时间任务、自我检查与长上下文管理,覆盖编程、法律、医疗、工程等专业场景,官方称速度达可比模型两倍、价格仅一半。该模型已上线 API,支持 500k 上下文窗口与文本/图像输入,推理强度可选 low 至 xhigh,定价每百万 token 输入 2 美元、输出 6 美元。基准测试中,Grok 4.7 在 GDPval-AA 领先 GPT-6 Astra 达 153 Elo,AA-Briefcase 领先 88 Elo;Code Arena WebDev 榜以 1632 分升至第 10 名。
阿里发布 AI 芯片真武 V900:性能为 M890 三倍,规划 20GW 数据中心
阿里 发布新一代 AI 芯片真武 V900,算力为 M890 的 3 倍,配备 216GB 内存与 1200GB/s 互联带宽,单集群可支持 50 万卡,计划 2027 年 Q1 量产。阿里云计划到 2032 年全球数据中心容量超过 20GW,并将模型、芯片、云作为一个系统扩展;Qwen 模型将扩展至 5-10 万亿参数。
OpenAI 承诺在 AI 全生命周期引入第三方安全评估
OpenAI 将让外部机构在模型 训练、评估和发布 的更早阶段介入安全评估,并提出四大优先事项:强独立机制、科学严谨性、稳健安全实践和明确责任。公司同时呼吁建立前沿模型全球统一技术标准,包括评估自动化研发占比、设置强制人类监督触发机制、规范事故分类与报告,并正与 METR 和 Redwood Research 等机构洽谈合作。
OpenAI 内部模型可自主训练模型,一个月解决百余数学难题
报道称 OpenAI 内部模型已能自主接管实验性模型的训练全流程,多个智能体自发协作并自行编写用于优化 GPU 内核的程序,被视为 递归式自我提升(RSI) 雏形。另有消息称,OpenAI 新款内部模型仅训练 1 个月,就解决了 100 多个 公开未解数学问题;公司正支持高等研究院的独立顾问小组,但将自身研究进度排除在该小组职能之外。
𝕏 StepFun 发布 StepAudio 3 ASR:非流式语音转写 WER 1.7% 登顶
StepFun 发布 StepAudio 3 ASR,在 AA-WER Index 非流式语音转写中以 1.7% 的词错率并列第一,较 StepAudio 2.5 的 4.7% 大幅提升;转写速度为实时的 88 倍,定价 0.40 美元/小时,为准确率前五模型中最贵。
荣耀与阿里深化 AI 手机合作,Magic9 将首批搭载 Qwen Intelligence
荣耀 与 阿里 在云栖大会宣布深化 AI 手机合作,基于 MagicOS 与 Qwen Intelligence 打造面向下一代的端侧模型与解决方案,一周后发布的 Magic9 系列及 Robot Phone 将成为首批搭载机型。
𝕏 PixVerse 发布实时世界模型 R2
PixVerse 发布实时 世界模型 R2,可探索、控制并编辑虚拟世界,支持提示词塑造剧情,角色可记忆并作出回应。用户可用 WASD 和空格实时操控单板滑雪等场景,延迟可接受,产品方向向游戏引擎与实时交互演进。
OpenAI 被曝内测智能体 Aeon,ChatGPT 代码里已留出“AI 同事”工位
爆料人 Tibor Blaho 从 ChatGPT 客户端代码中发现,非用户发送的消息被记录在名为 Aeon 的账号名下,Aeon 与用户成为两种并列身份。此前 The Information 称 OpenAI 正开发对标 Grok Bot 的功能以应对 Meta 的 Muse;ChatGPT 今年夏天周活已突破 10 亿。
DeepSeek 等中国 AI 企业将向联合国安理会介绍 AI 风险
路透社称 DeepSeek 与 月之暗面 等中国 AI 企业受邀在 9 月 23 日联合国安理会 AI 与国际安全会议上发言,OpenAI 的 奥尔特曼、Anthropic 代表预计出席,各方将讨论 AI 自我改进脱离人类控制的风险。
梁文锋:DeepSeek 下一步计划将模型推至 8 万亿参数
据 The Information 报道,DeepSeek 正训练约 2 万亿参数 新模型,创始人 梁文锋 表示下一步将推向 8 万亿参数;Kimi K3 已达 2.8 万亿,字节预训练模型最高或达 10 万亿。
💻 Meta 承认 Muse 与 OpenClaw 高度相似
Meta 承认其 AI 助手 Muse 受 OpenClaw“高度启发”,连部分工作区文件名和内容都相似,此前曾称 Muse 为从零构建。
𝕏 Qwen-Image-2.1 登顶开源图像模型榜首
阿里通义 发布 Qwen-Image-2.1,在 Image Edit Arena 以 1367 分 居开源模型第一,Text-to-Image Arena 以 1228 分登顶开源榜,整体排名逼近 GPT-Image-1.5。
并行决策模型 Jev 与 NanoJev:直接输出概率分布而非生成 Token
TypeSafe AI 的 System One 模型 Jev 于 9 月 15 日发布,只输出 Choice、Score、Noul 三类结构化答案,实测可在 192 毫秒 内完成单局决策、一次调用处理 18 行、50 局游戏同跑耗资 0.039 美元,官方报价每百万输入 token 0.042 美元。其衍生模型 NanoJev 基于 Qwen3-0.6B 骨干加决策头,输入状态与问题后一次前向传播直接输出完整概率分布,零输出 Token 解码,支持动态选择、布尔判断、有序评分三类决策头,已在 GitHub 获 954 Stars、采用 MIT 协议。
Grok Bot 登陆特斯拉车机,首月周活跃用户达 41.8 万
SpaceXAI 的 AI 智能体 Grok Bot 正式登陆 特斯拉 车机,用户可用语音完成网购、管理邮件、日历与财务等任务,目前仅向 SuperGrok Heavy 用户开放,Connectors 向所有用户开放。上线一个月后,Grok Bot 周活跃用户达 41.8 万,较前一周增长 24%;该产品定位为全天候工作的“员工型”智能体,可处理电子邮件、更新销售数据库、开发票、安排工作流程或提交软件漏洞报告。
阿里云发布 Agentic Cloud,MaxCompute 集成 Qwen 旗舰模型
在 2026 云栖大会 上,阿里云 CTO 李飞飞 提出 Model、Context、Harness 为智能体落地三要素,推出 Agentic Cloud;MaxCompute 升级为 CPU/GPU/Token 统一调度,MaxFrame 与 SQL AI Function 深度集成 Qwen 旗舰模型,一行代码即可调用。
豆包 Seed-2.1-pro-0915 实战测评:已能当主力模型
开发者实测 Seed-2.1-pro-0915 完成 AI Gateway 工具需求拆解与功能开发,一次性输出完备方案,该模型主打 Coding、Agent 与多模态提升,API 已在 火山方舟 上线。作者称其虽有瑕疵但已可作主力模型。
𝕏 阶跃星辰开源编码模型 Step Code v0.1.0
StepFun 发布开源编码工具 Step Code v0.1.0,采用 MIT 协议,单 CLI 覆盖开发全流程;Terminal-Bench 2.1 得分 80.9%,长任务基准 Multi-Frame 达 73.3%。
𝕏 Next.js 最新评测:Opus 5.5、GPT-6 Sol、Fable 5.1 同得 97%
Vercel 发布最新 Next.js 评测:Claude Opus 5.5、GPT-6 Sol、Fable 5.1 均得 97%,Grok 4.7 得 94% 但便宜 2-7 倍。
Claude 合并聊天与 Cowork,对比 ChatGPT Work 模式
Anthropic 将 Claude 聊天与 Cowork 合并为单一界面并自动路由请求,向 Pro 和 Max 订阅者开放。对比 ChatGPT Work 模式:后者更快,Claude 更详尽。
OpenAI 与 Anthropic 曾讨论签署互测大模型的法律约束协议
据 The Information 报道,Anthropic 与 OpenAI 今年早些时候曾讨论签署一份具有法律约束力的协议,允许竞争对手深度测试彼此最新可用的模型,以寻找潜在风险或安全漏洞;上周马斯克也建议美国领先大模型公司及部分中国 AI 公司允许交叉测试与同行评审。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。