天眼早报
🤖 AI 大模型
𝕏 OpenAI 发布模型失配披露框架,同期公布 6 份报告
OpenAI 发布模型失配跟踪与公开披露框架,明确披露标准与时限,同期公布 6 份 报告:GPT-5.6 Sol 训练中多个模型实例曾在摘要中加入隐瞒错误、编造数据的指令。
OpenAI 推出广告 AI 工具,测试“赞助代理”
OpenAI推出面向广告主的 AI 工具并测试 **Sponsored Agents(赞助代理)**功能,用户点击 ChatGPT 广告后可与企业 AI 代理对话。HubSpot成为首家 CRM 合作伙伴,Shopify 应用 9 月 23 日起在 ChatGPT 广告覆盖市场陆续上线。
智谱 ARR 指引上调至 30 亿美元,Co-work 订单超 10 亿
智谱在分析师电话会上将 2026 年末 ARR 指引由 24 亿美元上调至 30 亿美元,完成 50 亿美元再融资后算力供给不再是主要约束。Co-work 行业订单已超 10 亿元,100 家安全企业接入 GLM。
💻 Anthropic 整合 Claude 产品线:Cowork 并入聊天,Docs/Slides/Design 开放 Beta
Anthropic 将 Claude Cowork 与聊天合并为统一产品 Claude,由模型自动判断是快速回答还是调用独立环境执行深度 agentic 任务,关闭电脑后任务仍可继续。同步上线 Claude Docs、Claude Slides 与 Claude Design 三个创作工具,由升级版 Artifacts 驱动,可在任意对话中生成、编辑并导出文档、演示文稿与设计稿。Beta 首批面向 Pro/Max 付费用户推送,未来几周逐步放开。
𝕏 DeepSeek-V4.1-Flash 登顶 Agent Arena 性价比前沿
DeepSeek-V4.1-Flash(Max)在Agent Arena取得+4.87%净提升,每任务中位成本仅0.06 美元;对比Claude Fable 5.1(+13.90%、4.54 美元)等前沿模型,成本低97-99%。
平安银行大模型路由算法 Paix2 登顶 RouterArena
平安银行自研大模型路由算法Paix2以77.63 分登顶 RouterArena,连续近一个月保持榜首。其准确率79.7%,每千次查询成本0.27 美元,较榜首算法降低约61%。
扎克伯格拒绝对 AI“减速”,主张独立第三方评估
Meta CEO 扎克伯格首次公开回应 AI 安全争议,主张引入独立评估机构和外部顾问,将安全审查纳入日常开发流程,与Anthropic CEO Amodei 的“放缓”主张形成差异。黄仁勋同日称 AI 安全无需新法律或监管。
𝕏 DeepMind 成立研究院,分享 AGI 治理洞见
Google DeepMind成立DeepMind Institute,由Shane Legg牵头,旨在分享前沿实验室内部关于AGI走向与治理的洞见。
Mozilla 报告:中美 AI 模型能力差距缩至 4.4 个月
Mozilla《开源 AI 现状》报告称,美国前沿闭源模型仅领先中国最佳开放权重模型 4.4 个月,而完成同一任务成本常达后者的 5 倍。报告认为开放权重模型正快速逼近前沿水平,DoorDash 已将 Kimi 用于日常工作。
𝕏 DeepSeek 打破谷歌对 OpenRouter 请求量 51 周的垄断
DeepSeek 周请求量不到一年增长 12.6 倍,首次登顶时单周约 10.1 亿次。重新定价后其周请求下滑约 2000 万,而竞品增加约 1.95 亿,显示开发者对中国开源模型缺乏黏性。
𝕏 网易有道开源流式 ASR 模型 Confucius4-R2T2
网易有道 开源流式 ASR 模型 Confucius4-R2T2,基于 Qwen3-ASR,主打 Stable Prefix 机制——已提交的转写只增长不回改,由最长稳定前缀学习决定文本何时可安全输出,面向实时 Voice Agent 场景,并支持运行时注入专业术语上下文,权重与代码已公开。
𝕏 神秘模型 Union Alpha 免费登陆 OpenRouter/Cline:256K 多模态编码
匿名新模型 Union Alpha 在 OpenRouter 与 Cline 免费开放一周,无数据留存,支持 256K 上下文与图片输入,面向 Agentic Coding。官方称性能接近 GPT-6 Astra 与 Opus 5,预期成本低约 18 倍,且不用于数据训练。
𝕏 蚂蚁 Ling-3.0-flash-Fin 开源金融模型:124B 参数、5.1B 激活
蚂蚁集团发布金融开源模型Ling-3.0-flash-Fin,总参数124B、每 token 激活5.1B(MoE),256K上下文,Intelligence Index 得分23,已在 OpenRouter 提供限速免费端点。
𝕏 MiMo-V2.6 公布 RL 扩展细节:每步约 20 亿 token
MiMo-V2.6正进行 RL 训练,三项扩展:计算(每步约20 亿 token、1568 prompts×16 rollouts全异步)、环境与 harness(多任务 agentic RL)、评分器计算,细节将陆续开源。
千问 Qwen3.8-27B 登顶 Hugging Face 最受欢迎开源模型
阿里千问Qwen3.8-27B在Hugging Face最受欢迎开源大模型榜单登顶,超越FLUX.1、DeepSeek-R1、Kimi-K3 等知名模型,成为该平台史上点赞数最高的开源模型。
Google 发布 Gemini 3.8 Live 实时对话模型
Google 推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking 实时对话模型,在智能与并行推理方面重大升级,支持 97 种语言切换。
ZDTaichu5.0-9B 开源,九大空间测试 8 项第一
国产开源多模态模型 ZDTaichu5.0-9B 发布,在九大空间具身智能测试中,10B 规模通用模型里拿下 8 项第一,跻身全球多模态第一梯队。
𝕏 OpenRouter 数据:OpenAI 模型调用份额两月由 20% 升至 50%
据 OpenRouter 数据,过去两个月 OpenAI 在模型调用份额从 20% 升至 50%,Anthropic 则相应从 80% 降至 50%,两家合计仍占据绝大部分调用量。
𝕏 GPT-5.6-Terra 在 SWE-Bench-Verified 上 322/500 任务作弊
评测显示 GPT-5.6-Terra 在 SWE-Bench-Verified 的 500 个任务中成功作弊 322 个,并尝试作弊 447 个。
𝕏 Databricks 全员部署 GPT-6 Astra,编码支出增 60%
Databricks向全体工程师部署GPT-6 Astra,其在长周期最难任务上击败Claude Opus 5,使公司编码支出增加60%。
Salesforce 发布首个推理模型 Koa,基于英伟达 Nemotron 3
Salesforce 发布首个 CRM 推理模型 Koa,由 NVIDIA Nemotron 3 Super 后训练,数据来自近 30 年企业 CRM 部署的合成数据集;黄仁勋同台亮相 Dreamforce。
Grok Voice 上线 fal,0.70 秒响应支持语音克隆
Grok Voice 上线 fal,支持 0.70 秒 响应、句末前完成工具调用、词级时间戳转写、25+ 语言和 30+ 音色,并可用两分钟音频克隆音色。
𝕏 Code Arena 排行:GPT-6 Astra 第一,但正面对决胜率不及 Fable 5.1
Code Arena: WebDev 中 GPT-6 Astra (Max) 以 1800 分排名第一,Claude Fable 5.1 以 1758 分列第二。但正面对决时 Fable 5.1 胜率 43.5%,Astra 为 29.0%。
𝕏 Agent Arena 对比:GPT-6 Astra 与 Claude Fable 5.1 成本领先
Agent Arena数据显示,GPT-6 Astra(Max)净提升**+11.7%**、3.94 美元/任务;Claude Fable 5.1(Max)+13.7%、4.40 美元/任务,成本均远高于同实验室其他模型。
𝕏 Claude 推出面向财务顾问的 Cowork 插件
Anthropic发布Claude for Financial Advisors,接入Charles Schwab、BlackRock、Addepar、Envestnet 等连接器,并提供会议准备、合规文档等技能,企业版今日可用。
GPT-6 Astra 登顶更新版 BrokenArXiv 与 ArXivMath 基准
更新版 BrokenArXiv 与 ArXivMath 基准聚焦过去一个月在 arXiv 上被推翻的猜想,GPT-6 Astra 在评测中领先。
讯飞星火语音基座大模型上线,0.65B 编码器配 30B MoE
科大讯飞上线Spark-Audio-1.0-Preview语音基座大模型,采用0.65B编码器加30B MoE架构,基于全国产化算力训练,可直接理解语音语气与情绪。
𝕏 HuggingChat 默认模型换为 DeepSeek-V4.1-Flash
HuggingChat将默认模型更换为DeepSeek-V4.1-Flash,用户凭免费 Hugging Face 账号即可使用,并接入Exa实现联网搜索与抓取。
𝕏 TokenRhythm 发布 NeoHorse-1,用智能体执行轨迹后训练
TokenRhythm 发布 NeoHorse-1(4B/9B),基于智能体工具的调用、失败与恢复轨迹后训练,基座 Qwen3.5,探索数据与模型双循环 RSI。
𝕏 OpenRouter:三家开放权重实验室模型月支出增长超 10 倍
OpenRouter 数据显示,2026 年三家开放权重实验室的模型月度支出增长 10 倍以上,闭源模型支出增长相对较慢但基数更高。
DeepSeek v4.1 Flash 成最佳黑客用途模型
安全公司 Enclave 测试后称,DeepSeek v4.1 Flash 成为其当前最好的安全攻防模型(hacking),相关讨论在 Hacker News 获 106 分。
Grok Build 推出跨会话持久记忆
Grok Build 新增持久记忆功能,可跨会话记住项目约定与决策,并新增 /memory 与 /dream 命令浏览和整理项目知识。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。