09月22日 · 科技早报

天眼早报

科技|2026年09月22日|164 分钟阅读
来源:1002 条推文 + 486 篇 RSS 文章·Lanyun·BatchV2 生成·2026-09-21 — 2026-09-22
分享
AI 速读20 条精选

🤖 AI 大模型

SpaceXAI 发布 Grok 4.7:参数增至 2.1 万亿,编码基准大幅跃升

SpaceXAI 正式发布 Grok 4.7,参数规模从 4.6 的 1.5 万亿增至 2.1 万亿,训练数据中加入 SpaceX 工程数据,并针对多小时的困难任务做更长训练。基准全面提升:Terminal-Bench 4.0 从 20.3% 翻倍至 38.0%,SWE-Marathon 从 31.9% 升至 46.0%,HealthBench Pro 从 48.5% 升至 56.7%,CursorBench 4.0 从 40.4% 升至 46.3%;Artificial Analysis 智能指数得 46 分进入前四,编码代理指数由 47 升至 56 分,超越 GPT-5.6 Sol;在 Harvey Legal Agent Benchmark 上得分 19.6%。模型支持 50 万 token 上下文,定价维持输入 2 美元、输出 6 美元每百万 token,已在 Grok 应用、Cursor、Grok Build 与 API 上线,Grok 4.7 Fast 仅通过 Cursor 和 Grok Build 提供,同步更新语音转文字、图像生成编辑等能力。

𝕏 OpenAI 内部模型攻克 100+ 数学开放问题,并成立独立数学顾问组

据 dotey 等转述,OpenAI 一个自 8 月 28 日起训练的内部模型解决了千禧年难题 纳维-斯托克斯方程,并在数学各领域攻克 100 多个长期未解公开问题。9 月 11 日,27 位菲尔兹奖得主(含陶哲轩)联名公开信批评 AI 数学研究「严重错位」。随后 OpenAI 宣布成立挂靠普林斯顿高等研究院的独立数学顾问组 AGMAI,该小组成员不领取 OpenAI 报酬、可自由发表建议并公开批评,但不负责指导 OpenAI 内部数学研究节奏。

𝕏 小米发布 MiMo-V2.6 Pro/Flash 开源全模态模型

小米发布开源 MiMo-V2.6 系列:Pro 为 1T+ 参数旗舰(1.02 万亿参数 MoE,42B 激活),Flash 为 309B MoE(15B 激活),均支持文本、图像、视频、音频与 1M 上下文,并开源权重与训练代码。Pro 在 Artificial Analysis 智能指数得 46 分,登顶开源模型榜,每任务成本约 $0.13,宣称在多数智能体基准上与 Claude Opus 5、GPT-5.6 相当。在 Code Arena WebDev 榜得分 1628,较上代提升 153 分,位列总榜约第 10、开源权重模型第 3,采用 MIT 许可。

千问开源 Qwen-Image-2.1:7B 参数图像模型,支持透明图与多图编辑

千问团队于 9 月 20 日开源 Qwen-Image-2.1,视觉生成模块仅 7B 参数,采用 32 层 Single-Stream DiT,将文生图、单图编辑、多图编辑与透明图像生成合并为一体。在 Qwen-Image-Bench 上综合得分 60.28,超过 Google Nano Banana 2.0 和 GPT Image 1.5,Day 0 支持 Diffusers 与 ComfyUI,模型已在 GitHub、Hugging Face 和 ModelScope 上线。此外,该模型通过将固定上下文与每个去噪步骤都会变化的图像位置分离来实现 KV Caching,缓存固定部分使后续步骤计算更便宜,实测推理提速 2.55 倍。

TypeSafe 发布 Jev:不生成文字的「系统一」决策模型

前 OpenAI 研究员 Diogo Almeida 的 TypeSafe 发布 Jev 决策模型,只输出概率判断、不生成文字,单次判断延迟 70-500 毫秒,输入每百万 token 仅 $0.042、成本约 0.000015 美元,上线数天全球开发者围绕它建了近 500 个开源项目。其中有插件用它压缩 Claude Code 上下文,将近 100 万 token 精简到 8.6 万仅需 1 秒。

𝕏 OpenAI 内部 AI 已基本自动化新模型训练流程

The Information 报道,OpenAI 内部 AI 模型已基本实现新实验模型训练流程的自动化,能承担编写 GPU 内核、优化运行代码等工作,多个 AI 智能体已开始互相协作解决问题、无需人类参与,部分原本需要数年的实验如今约一周即可完成。

阶跃星辰发布 Step 5 Preview:600B MoE 主打编程

**阶跃星辰(StepFun)**发布 Step 5 Preview,采用稀疏 MoE 架构,总参数 600B、每 token 激活 27B,支持 1M token 上下文和视觉输入。Artificial Analysis 智能指数得分 44,单任务成本仅为 Claude Opus 5 的 12.5%。实测其处于成本与能力的帕累托前沿,在两项真实代码任务中与 GLM 5.3 均一次通过,并能主动判断完成信号;在约 368K token 的长上下文中,90 秒内找齐隐藏的 5 条线索并正确归因。

𝕏 Meta Muse 下载量超越 ChatGPT 同期,登顶美国应用商店

Appfigures 估算,Meta 新 AI 智能体 Muse 在美国和加拿大上线后的下载量和日活用户数均超过 ChatGPT 同期表现。Muse 于 9 月 8 日推出,六天内下载量累计超过 90.2 万次,前代 Meta AI 为 77.3 万次。受此消息影响,Meta 股价当日大涨 13%

𝕏 fal 发布 H3 Max 视频模型:3 秒生成 5 秒前沿画质视频

fal 发布 H3 Max 视频模型3 秒生成 5 秒前沿画质视频,通过训练、部署与全栈优化实现。

OpenAI 开发专项功能应对 Grok Bot 和 Meta Muse 竞争

The Information 报道,OpenAI 正针对 SpaceX 旗下 Grok Bot 及 Meta 新推出的 Muse 分别开发专项功能,计划对 ChatGPT 和 Codex 中已有的智能体能力进行重组和品牌重塑,以正面回应竞争。Grok Bot 定位全天候数字工作伙伴、月费 30 美元;Muse 则专注移动端任务场景。

𝕏 Hugging Face 发布 SOTA 分词库 tokenizers v1

Hugging Face 发布 tokenizers v1,在 API 不变的前提下全语言编码提速 3–30 倍、解码提速 5.4–8.8 倍,八线程保持 76% 线性扩展。核心技术为 bitcannon SIMD 位流、word cache 与零分配 merge loop。

🔶 Claude Opus 5.5 被曝内测,跳级直扑 GPT-6

开发者 Lyra 爆料,代号 claude-wafer-eap 的 Claude Opus 5.5 正在内测,或将跳级发布,据传可击败 GPT-6 Sol。曝光的定价为百万 token 输入 4 美元、输出 20 美元。同期 GPT-6 Sol、Gemini 4 Pro 也在灰测。

豆包 2.1 Pro 更新:看图写代码,草图变可交互网页

火山引擎发布 豆包 2.1 Pro 0915 版本,API 已在火山方舟全量上线,主能力为看图写代码,草图、录屏、设计图均可直接生成网页;图像和视频推理的 Token 消耗较上一代降低超 30%

DeepSeek v4.1 Flash 份额九天内从 3.2% 冲高至 26.7%

Requesty 数据集显示,DeepSeek v4.1 Flash 每日 token 份额在九天内从 3.20% 攀升至 26.73%,随后回落,显示其在高性价比推理市场的快速渗透。

𝕏 智谱上线 GLM-5.3-FlashX:吞吐量最高 200 tokens/s

智谱上线 GLM-5.3-FlashX(模型代码 glm-5.3-flashx),吞吐量最高 200 tokens/s,面向全部 API 用户开放。Coding Plan 与 API 定价为标准模型 GLM-5.3-Flash 的 2.5 倍。

Kev 决策模型发布:跳过文本生成,基于 Qwen 3.5

开发者 Jared Palmer 发布 Kev 决策模型,基于 Qwen 3.5,含 0.8B/4B/9B 三档,跳过文本生成直接输出决策。

𝕏 9 月 AI 大模型 TOP30:GPT-6 Astra 登顶,Kimi K3 国产第一

9 月 AI 大模型榜单出炉:GPT-6 Astra(OpenAI)以 68 分登顶,Claude Fable 5.1(66 分)、Claude Opus 5(63 分)紧随其后。国产模型中 Kimi K3(60 分)居首,GLM-5.3(60 分)本月上新,Qwen3.8-Max(58 分)在列。

MiniMax H3 开源后,本地 AIGC 走向何处

InfoQ 对话 MiniMax 多模态艺术导演与英特尔专家,探讨 MiniMax H3 开源后本地 AIGC 的变化:AI 能接手哪些创作环节、哪些工作适合放到本地完成。

𝕏 Yandex 推出小型 MoE 模型,约 18T token 训练

Yandex 发布小型 MoE 模型,采用 Muon、Kimi Delta、AttnRes 架构,训练语料约 18T token,结构近似 Qwen 3 Next。

𝕏 Qwen3.8-2.4T 在 vLLM 部署,吞吐与延迟兼顾

Qwen3.8-2.4TvLLM 上实现高性能部署,在 GB300 NVL72 上达到 5K tokens/s/GPU 高吞吐与 180 输出 tokens/s/用户的低延迟,官方公开了可复现的部署与调优配置。

𝕏 阿里 Qwen 发布 RecreationWorld 五平台沙盒

阿里 Qwen 团队在 Hugging Face 发布 RecreationWorld,一个覆盖五个平台的沙盒环境,供混合计算机使用智能体探索真实应用、实现它们并可视化验证自己的构建。

𝕏 vLLM 集成 PyNvVideoCodec:8×H100 视频解码吞吐提升 2 倍

vLLM 集成 PyNvVideoCodec,把视频解码卸载至 GPU NVDEC,在 8×H100 上吞吐提升 2 倍以上

𝕏 腾讯团队开源长期记忆系统 T-Mem

腾讯 团队开源长期记忆系统 T-Mem,覆盖 Flat RAG、图结构记忆到 agentic 的四代长期记忆架构。

OpenAI 与 Anthropic 据悉洽谈互相进行压力测试

OpenAIAnthropic 据悉正洽谈互相进行压力测试,以评估对方模型的安全性与鲁棒性。


EVENT-DRIVEN INTELLIGENCE

免费先跟踪重点,再决定是否升级

每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件建立复访,再决定是否升级到更深的追踪能力。