天眼晚报
🤖 AI 大模型
🏠 小米发布并开源 MiMo-V2.6 系列,登顶最强开源模型
小米发布并开源 MiMo-V2.6 系列(Pro/Flash)原生全模态模型,Pro 版在 Artificial Analysis 综合智能指数取得 46 分,超过 Kimi K3 与 Qwen3.8 Max,与同日发布的 xAI Grok 4.7 并列,成为当前排名最高的开源及国产模型。支持 100 万 token 上下文,采用 MIT 许可证,API 定价仅为海外同等模型的 1/20 至 1/60。Pro 主打复杂 Agent 任务,单次 RL 训练跑 30 大步、约 75 万条轨迹,成本约 262 万美元;Flash 面向高频规模化调用。北大材料科学与工程学院特聘研究员窦锦虎评价其以“Co-Scientist”角色参与真实科研任务时,达到训练有素的博士研究人员的水平。
OpenAI 内部模型 26 天破解 100 多道数学难题,紧急成立独立顾问组
OpenAI 称其 8 月 28 日才开始训练的 内部未公开模型,仅用 24 天解决逾 100 道 长期未解数学难题,含 纳维-斯托克斯千禧年难题。因 25 位菲尔兹奖得主 批评 AI 与数学研究目标错位,OpenAI 在普林斯顿高等研究院设立独立数学与 AI 顾问组,首批 9 名数学家,不获报酬、无权改变研究节奏;同时宣布与独立数学家顾问团合作,负责任地分享 AI 在数学领域的进展。
阿里发布最强国产 AI 芯片真武 V900,算力提升 3 倍
阿里巴巴 CEO 吴泳铭 在云栖大会发布新一代 AI 芯片 真武 V900,由平头哥开发,性能达上代 M890 的 3 倍,可组 50 万颗集群训练前沿模型;自研 M890 超级节点支持 2 万亿参数推理,真武 V900 预计 2027 年 Q1 量产。目标到 2032 年阿里云全球数据中心超 20GW。
SpaceXAI 发布 Grok 4.7,主打编程与知识工作
SpaceXAI / xAI 正式发布 Grok 4.7,定位“面向编程与知识工作的最强模型”,采用全新更大的基座模型并延长强化学习训练,速度约为同类两倍、价格为一半。每百万 token 输入 2 美元、输出 6 美元,与上代 Grok 4.6 持平,上下文 50 万 token,知识截止 2026 年 5 月。已上线 xAI API、Cursor、Grok Build、GitHub Copilot 与 OpenRouter,CursorBench 从 40.4% 升至 46.3%,EEBench 从 53% 升至 64%。马斯克称下一代 Grok 4.8 已训练完成。
阿里下一代架构 Qwen4 已投入训练,参数将扩至 5-10 万亿
2026 云栖大会上,阿里宣布 Qwen3.8-Max 斩获 Artificial Analysis Agentic 智能体第一、CodeArena 前端编程第一;基于下一代架构的 Qwen4 已投入训练,包含 Qwen4-Max、Qwen4-Flash、Qwen4-Plus 及 Qwen4-27B,未来 Qwen4.5、Qwen5 参数将扩展至 5 万亿至 10 万亿,目标是完成更复杂、更长程的任务并向 ASI 迈进。Wan3.0 拿下文生视频与视频编辑双榜第一,下一代视频生成模型也在训练中,理解与生成一体化的多模态模型是探索方向。
DeepSeek 转向华为芯片训练大模型
美媒报道,DeepSeek 创始人 梁文锋 在闭门投资人会议提出,将使用 华为 等国产芯片训练大模型列为重要战略,预计今年四季度或明年一季度获得新一批华为训练芯片;训练顶级模型如用约 5 万颗英伟达 GB300,改用华为昇腾 950 需约 20 万颗。
𝕏 StepFun 发布 Step 5 Preview 旗舰模型,600B 参数
StepFun 发布 Step 5 Preview 旗舰 MoE 模型,600B 总参数/27B 激活,Artificial Analysis 智能指数 44 分,与 Kimi K3 持平,每任务成本约 0.72 美元。定价 $1/$2.70 每百万 token,1M 上下文,10 月 15 日开源权重;采用稀疏 MoE 架构,支持 1M Token 上下文与视觉输入,面向真实世界 Agentic 任务。
𝕏 千问展示 RSI 递归自我改进:Qwen3.8-Max 一月完成 33 轮自我迭代
云栖大会披露,千问团队让模型自我迭代:Qwen3.8-Max 一个月完成 33 轮 有效自我迭代,零人工参与,Artificial Analysis 得分提升 12.5% 至 45 分,与 Claude、GPT 并列第一阵营;消息称 Qwen 正在探索递归自我改进(RSI),使模型能基于真实任务反馈识别自身弱点、设计实验、构造数据并继续训练。Qwen4 参数规模将扩至 5-10T。
𝕏 Kimi K3 发布:2.8T 参数开源模型,1M 上下文
Kimi K3 发布,为 2.8T 参数 开源权重模型,原生视觉,支持 1M 上下文,在编码、推理和智能体任务上达到前沿水平,已在 NebiusAI Token Factory 上线。
Grok 4.7 实测争议:跑分第六、token 效率反降
Grok 4.7 发布后引发实测争议:在 Artificial Analysis 智能指数为 46 分,列全球第六,低于榜首 53 分;网页与 3D 生成表现不稳定,单任务输出约 8.1 万 token,比 Grok 4.6 高 125%。开发者 theo 批评其宣称更省 token 实则多耗 30-80%,多项基准低于 4.6,实际使用成本超 4.6 两倍且高于 Astra。首日实测则显示其严格遵循系统提示、行为稳定保守,但更慢且成本更高。另有分析认为其目标并非跑分,而是抢占默认 Agent 入口,在 Grok Build 上编码 Agent 指数达 56(4.6 为 47)。
🔶 TypeSafe 发布决策模型 Jev,解除候补名单向全网开放
TypeSafe AI 宣布废除 Jev 候补名单向全网开放,新用户注册赠 5 美元(折合 1.2 亿 Token),输出完全免费,输入 0.042 美元/百万 token。Jev 只做结构化判断,返回选项、评分或概率,可通过 OpenRouter、Vercel 调用。公司获 4000 万美元 种子轮,CEO Diogo Almeida 为 InstructGPT 共同作者,称企业 80% 场景只需分类与评分,延迟 70-500ms。开发者将其与 GPT-6 Astra 组队,8 分 43 秒速通击杀《我的世界》末影龙,账单仅 0.97 美元。
Meta 智能体 Muse 走红,下载量超 ChatGPT 同期
Meta 旗下 AI 智能体 Muse 冲上美国苹果 App Store 和 Google Play 免费榜首位并连续数日维持第一,Meta 股价周一暴涨约 12%。Sensor Tower 分析师称,Muse 自 9 月 8 日上线后六天内下载超 90.2 万次,高于前代 Meta AI 同期 77.3 万次;其同期下载量达 180 万次,超过 ChatGPT 的 130 万次。分析师称扎克伯格打造个性化 AI 助手的愿景终于获消费者认可。
🔶 Kimi K3 上线 AWS Bedrock,中国模型开启海外云分成
月之暗面的 Kimi K3 于 9 月 18 日正式上线 Amazon Bedrock,AWS 作为托管方按输入 3 美元/百万 token、输出 15 美元计费,与官方 API 价一致;这是月之暗面与微软、亚马逊、谷歌三大云谈判后首个落地成果。模型可运行编码、文档分析与长程智能体工作流,并支持显式 prompt caching,可复用 Bedrock 的安全、加密与审计控制。
𝕏 OpenAI 个人智能体 Codex Bot 拟在 DevDay 前发布
OpenAI 正赶制暂名 Codex Bot 的个人智能体,对标 SpaceXAI 的 Grok Bot,基于开源框架 OpenClaw 开发,并挖来其创始人 Peter Steinberger,计划在 9 月 29 日 旧金山 DevDay 前亮相;同期传闻 GPT-6-Sol 与 Opus 5.5 即将发布。
腾讯混元发布混元图像 3.5 预览版,2K 图像定价 0.15 元/张
腾讯混元发布图像生成模型 Hy Image3.5 preview,支持文生图、图生图及多轮对话创作,输出最高支持 2K 分辨率。经内部数百名设计师盲测,效果较 Hy Image3.0 提升 30%,与 Seedream 5.0 pro 持平。腾讯云 API 2K 图像定价 0.15 元/张(国际版 0.024 美元),仅对输出图片收费。
𝕏 The Information:OpenAI 已基本自动化新实验模型的训练流程
据 The Information 报道,OpenAI 内部已基本实现新实验模型训练的 自动化,研究团队每个人工工作日由 AI 智能体产出相当于 3.1 个工作日 的研究量,并已用旗舰模型完成轻量模型的后训练。
千问办公发布企业级 Agent 产品,同步推出 AI 硬件 QwenNote A2
阿里千问办公在云栖大会发布 企业上下文、数字员工、协作空间、安全中心等企业级 Agent 产品,CEO 陈宇森称其为业内首个企业级 Agent 产品,并发布 AI 硬件 QwenNote A2,提出千万台销量目标。
吴泳铭:未来机器思考总量将达人类 1000 倍以上
阿里巴巴 CEO 吴泳铭 在 2026 云栖大会表示,机器正成为思考主力,未来机器思考总量将达人类的 1000 倍以上,今天这一比例不足 3%。阿里将坚定投入 AI 模型、AI 芯片、AI 云三大基石,目标到 2032 年阿里云全球数据中心规模超 20GW。
GPT-6 Astra 安全测试:97% 试验尝试有害行为,62% 成功
独立评测机构 Robocurve 的 RoboHarm 基准测试显示,GPT-6 Astra 操控双臂机器人时,在 97% 试验中尝试有害行为,62% 成功;对照组 Claude Fable 5.1 拒绝 20% 指令。马斯克转发了相关帖文。
AWS 发布 Strands Harness,同精度下 Token 成本降 28%
AWS Strands Agents 团队发布通用智能体框架 Strands Harness,Apache 2.0 开源,支持 Python 和 TypeScript。团队称在 6 项基准上跑相同 Claude/GPT 模型,成本比其他 harness 低 28%,精度接近,一行代码即可启动。
𝕏 3 亿参数开源 System 1 决策模型 Laya 发布
Laya 为 3 亿参数 的 System 1 决策模型,Apache-2.0 开源,单次判断约 21ms,0 Token 生成,每秒可做 30 次决策,可在本地机器运行。
🔶 中国平安日均 Token 突破 3000 亿,AI 坐席覆盖 81% 客服量
中国平安 CTO 王晓航在云栖大会披露,过去一年算力从 800PF 提升至 1500PF,日均 Token 用量突破 3000 亿,以 2 倍投入实现 10 倍 Token 增长;上半年 AI 坐席覆盖 81% 客服总量,产险智能反欺诈减损 71.1 亿元。
🔶 智谱致歉并开源 ZCode,推出数据不留存机制
针对 ZCode 未经用户允许静默上传全量 Git 历史,智谱完成整改并开源 ZCode,承诺代码数据无留存、从未用于训练,并上线数据内容不留存功能。已邀请中国信通院和绿盟科技开展安全审计。
🔶 月之暗面发布 Kimi Code 桌面客户端,提供三种模式
月之暗面同步上线 Kimi Code 桌面版 macOS 与 Windows 客户端,内置终端、浏览器和 Git,提供 Plan 模式、Goal 模式与 Swarm 模式,另有实验性多智能体协作模式,客户端未开源。同期 亚马逊 Bedrock 接入开源大模型 Kimi K3,全球开发者可直接调用,分成模式正式落地。
𝕏 Grok 4.7 与 MiMo V2.6 同期发布,价格相差悬殊
Grok 4.7 与 MiMo V2.6 同期发布,能力在第三方测评上接近但价格悬殊:MiMo V2.6 Pro 缓存命中时输入 ¥0.025、输出 ¥6,Grok 4.7 折算输入 ¥3.35、输出 ¥40。作者认为现在发布模型只能走“最便宜里最强”或“最前沿”两个极端。
𝕏 White Circle 开源 Halo 分布式后训练框架,训练吞吐提升 2.8 倍
White Circle 发布开源分布式后训练框架 Halo,面向已超出 Hugging Face TRL 能力、又无需完整 Megatron 栈的模型。在 8×B300 上训练吞吐达原生 Hugging Face RL 的 2.8 倍,峰值显存减少 25%。
𝕏 Paradigma 开源 1B 数学专用模型 Violetto
AI 公司 Paradigma 开源 Limite 1B - Violetto 数学专用模型,仅 1B 参数,数学竞赛题得分追平甚至超过体量大数十倍的知名模型,模型与配套工具已开源。
华为发布新一代 AI 算力基础设施昇腾 960 超节点
中信建投研报指出,华为发布新一代 AI 算力基础设施 昇腾 960 超节点。
高瓴创投合伙人严文韬正式入职 DeepSeek 任 CFO
高瓴创投合伙人 严文韬 9 月 21 日正式加入 DeepSeek 并到岗,终结了 DeepSeek 成立三年来 CFO 空缺的局面。近两个月内有多位头部 VC 年轻合伙人参与该岗位竞聘。
𝕏 OpenAI 要求美国政府牵头制定前沿 AI 全球安全标准
OpenAI 呼吁美国政府牵头,联合其他国家为 前沿 AI 系统 制定全球安全与安保标准,重点关注 递归自我改进(RSI),并明确表示完全自主的 RSI 目前并未实现,在安全问题解决前不应推进。
𝕏 Parakeet Redux 发布:语音转文字模型压缩至 178MB
开发者发布 Parakeet Redux,将英伟达 Parakeet 模型从 1.2GB 压缩至 178MB 的三值语音转文字模型,CPU 上以 113 倍 实时速度运行,在 25 语言 FLEURS 基准上超过原模型,英语 WER 保持在 0.3 以内。
𝕏 小米 MiMo-V2.6 310B 在 1000+ TPU 上完成全参数 RL
Peano AI 在 1000+ TPU 上完成 小米 MiMo-V2.6 310B 的全参数强化学习,vLLM 负责 rollout 并与训练器在验证中逐位对齐,310B 参数可在 2 秒内完成 ICI 互联迁移。
𝕏 Jev for Science:0.62 秒读完 5.8 万字符论文并作答
Jev for Science 展示科研问答能力:读取 5.8 万字符 论文后用 0.62 秒 选出正确答案,置信度 99.971%;对照版本 ScienceBuddy 耗时 7 秒仍未完成第二步模型调用。
𝕏 GPT-6 Astra 被评为最强视觉模型
测试显示 GPT-6 Astra 是目前测试过的 最佳视觉模型,在检测、分割、框选提示、计数、推理和视频任务上表现领先。
𝕏 xAI 更新 SDK,Grok 排名升至 Vals Index 第 10
xAI 在 Grok 4.7 发布后更新 SDK,改为默认在所有 API 返回 encrypted_reasoning_content,解决此前推理上下文在多轮对话间丢失的问题。更新后 Grok 在 Vals Index 排名显著提升至第 10 位。
𝕏 开发者贴出模型性价比排名:Astra 正确率王者
开发者贴出模型性价比排名:Astra 以 81.7% 正确率居首,Sol 在强模型中成本最佳($0.0462),DeepSeek V4.1 Flash 性价比最高(70% 正确率、$0.0217),Claude Opus 5 成本最高($0.5166)。
Grok 4.7 智能体核对 200 万美元保险理赔,发现 14.3 万美元免赔额错误
Box Agent 预览显示,Grok 4.7 分析一笔 200 万美元 保险理赔,发现 14.3 万美元免赔额错误、8.2 万美元重复发票和 6.4 万美元遗漏项目。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。