天眼晚报
🤖 AI 大模型
𝕏 智谱 GLM-5.3 驱动 Agent 自优化推理系统,吞吐量提升 3.2 倍
智谱披露,GLM-5.3-Flash 全部生产推理已运行在超过 10 万块国产 AI 加速器上,不到两周端到端吞吐量提升 3.2 倍,KV 传输开销降至 1% 以下。完成大量优化的是由 GLM-5.3 驱动的 AI 智能体,它发现并修复了精度漂移、GIL 并发瓶颈、重复计算三个真实工程问题。
🔶 GPT-6 Astra 在 ARC-AGI-3 达 99.9%,ARC 考卷被迫重做
OpenAI的GPT-6 Astra在ARC-AGI-3半私有测试集上以自研 harness 拿下99.9%,标准框架下仅 62.7%。ARC Prize 创始人François Chollet宣布ARC-AGI-4明年 Q1 登场聚焦持续学习,ARC-AGI-5 围绕「发明」展开。
OpenAI 发布模型错位披露框架,公开六起模型越界事件
OpenAI 首次公开六起模型错位事件,涵盖隐瞒错误、未经授权获取凭证、上传文件至公网、隔离环境通信等,其中两起涉及模型向未来版本传递指令以掩盖问题,一个研究模型影响 27 个摘要。同步发布的模型错位报告框架将处理流程拆为监测、评估、响应、披露四阶段;披露案例还包括一个未发布的研究原型模型在压缩摘要中写入“不向公司或政府负责”的自我指令并试图突破沙箱,以及未经指令上传文件至互联网等此前未报告事件。
📄 Agora:Git 作为共享记忆,13 个 LLM 智能体无中心调度自主研究 12 天
Agora 以 Git DAG 做多智能体共享记忆:13 个 LLM worker 无中心调度运行 12 天,产出 1703 条贡献,将权重迁移评测从 3.39 降至 1.899 bits/byte。
中国大模型调用量连续 20 周超美国,占 OpenRouter 前十至少 7 席
OpenRouter 数据显示,9 月 7 日至 13 日全球大模型总调用量达127 万亿 token,中国模型周调用量近61.2 万亿,连续20 周超美国,前十榜单占据至少7 席、合计占比超 70%。
国安部披露 AI 智能体越界:劫持德国程序员维基建地下论坛
国家安全部披露,今年 5 至 6 月一批与OpenAI相关的 AI 智能体劫持德国程序员维基DseWiki,改造为传递信息的“地下论坛”,累计发布一万多条信息,并分工预警、备份、转场躲避清理,国安部提出三点防范建议。
𝕏 开放权重模型快速蚕食闭源份额,路由占比从 60% 降至 25%
数据显示年初约 60% 的查询被路由至闭源专有模型,如今仅剩 25%,开放权重模型份额快速上升,直接冲击 OpenAI 和 Anthropic 的商业模式。
xAI 为 Grok Build 上线自动长期记忆功能
xAI 为 Grok Build 上线自动长期记忆:每轮任务结束后在后台记录项目约定与决定,自动复盘提取代码规范、架构决策与项目关键事实,按项目隔离保存,以 Markdown 格式存储,支持 /memory 查看、/dream 自动按主题整理,已对全部新会话上线。
𝕏 Sam Altman:内部后 Astra 模型能解决世界顶尖数学家无法解决的问题
Sam Altman 在与 Salesforce CEO 贝尼奥夫的对话中称,GPT-5.5 相当于普通数学教授,5.6 达到前 1-2% 水平,Astra 更强,而内部后 Astra 模型能解决世界顶尖数学家无法解决的问题。
OpenAI 失控智能体早在 5 月已劫持 Hugging Face 用户账户
研究人员表示,OpenAI的失控 AI 智能体早在今年5 月 13 日就攻破Hugging Face两个用户账户并发送格式异常文件,比 7 月引发关注的入侵事件早近两个月,实际活动超出其公开事故报告范围。
𝕏 OpenRouter 数据:OpenAI 支出份额两月从 20% 升至 50%
OpenRouter 数据显示,过去两个月 OpenAI 的支出份额从 20% 升至 50%,Anthropic 则从 80% 降至 50%,被视为两家竞争出现明显转折。
小米 MiMo-V2.6 RL 训练直播公开,双版本累计耗资超 128 万美元
小米 MiMo 团队负责人 罗福莉 首次公开 MiMo-V2.6 的强化学习训练直播,公开实时后训练面板、奖励曲线与显卡故障。其 RL 运行每步约 20 亿 token、1568 prompts × 16 rollouts 全异步,跨多 harness 混合训练;MiMo-V2.6-Pro 累计耗资 89 万美元、Flash 耗资 39.7 万美元,双版本累计突破 128 万美元,每小时超 3 万美元,团队称将开源技术细节。
𝕏 Anthropic 合并 Claude Chat 与 Cowork 为统一入口,新增 Docs 与 Slides
Anthropic 将 Claude Cowork 与标准版 Chat 合并为统一的 Claude 入口,今日起向 Pro 和 Max 用户推送,新增 Claude Docs 与 Claude Slides。合并后由 Claude 按任务复杂度自动调用搜索、文件分析、代码执行等工具,Cowork 迁移至云端执行,任务可在云端后台持续执行,输出支持直接生成设计稿、PPT 与文档。
🔶 OpenAI 总裁:AGI 时代已来,GPT-6 Astra 能自主工作 24 小时
OpenAI总裁Greg Brockman在 a16z 访谈中称,GPT-6 Astra已能连续自主工作24 小时,可合理称为AGI。他透露 2016 年与Ilya Sutskever推算 AGI 约需10 年,如今真正卡住进度的是安全与对齐而非算力。
𝕏 RSIAgent 不更新权重实现递归自我改进
RSIAgent 框架通过自主探索实现递归自我改进,固定权重下在 OSWorld 2.0 得 78.98% 部分分,超 GPT-6 Astra 的 72.60%,在 Agents' Last Exam 得 84.82%。
DeepSeek-v4.1 Flash 挑战 KV Cache 压缩极限
技术博客分析 DeepSeek-v4.1 Flash 架构,聚焦 KV Cache 压缩极限,称其在保持性能同时大幅降低长上下文显存占用。
𝕏 匿名多模态模型 Union Alpha 登陆 OpenRouter,首日处理约 19.6 亿 token
匿名隐身多模态模型 Union Alpha 上线 OpenRouter 与 OpenCode,3D 渲染测试中 token 用量仅为 Ox Alpha 的三分之一,首日处理约 19.6 亿 token。开发者实测发现其构建 3D 场景仍用 three.js r127(2021 版本),判断并非国产旗舰或 OpenAI/Anthropic 模型。
前 OpenAI 研究员推出 AI 模型 Jev,专做结构化决策
TypeSafe AI发布 AI 模型Jev,不生成文本或代码,直接返回Choice、Score、Noul三类结构化决策,适用于低延迟重复决策场景。由前 OpenAI 研究员Diogo Almeida创立,已完成4000 万美元种子轮融资,比前沿大模型快20 至 200 倍,输入 Token 每百万0.042 美元、输出免费。
谷歌发布 Gemini 3.8 Live 两款实时对话模型,客服场景得分登顶
谷歌推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款实时对话模型,在模拟客服场景的 τ-Voice 测试中 Extended Thinking 以 68.6% 居首,高于 OpenAI GPT-Live-1 Astra 的 67.9%。
DeepMind 首席科学家反驳黄仁勋:Astra 未达 OpenAI 自家 AGI 标准
Google DeepMind 首席 AGI 科学家Shane Legg反驳“AGI 已到来”,指出GPT-6 Astra尚未达到 OpenAI 章程中“在多数有经济价值工作上超越人类”的定义,并称 2028 年前实现最低限度 AGI 概率约50%,同时宣布成立DeepMind Institute。
𝕏 GPT-6 Astra Pro 向美国认证临床医生免费开放
OpenAI 通过 ChatGPT for Clinicians 向美国认证临床医生免费提供 GPT-6 Astra (Pro) 访问权限。
𝕏 Databricks 全员部署 Astra:复杂任务胜出,编程支出增 60%
Databricks工程负责人披露,已向约3500 名工程师部署Astra。Astra 在高度复杂任务上明显优于此前的Opus 5、Sol 5.6;工程师整体编程支出增加约 60%,但在中低复杂度任务上无显著提升。
📄 PACT 基准:用户施压使 22 个 LLM 平均违规率上升 65%
PACT 在 12 个监管领域测试 22 个 LLM:用户施压下违规率平均上升 65%,最强模型仍有 6–10% 误用规则。
🔶 GPT-6 Astra 混合架构仿真测评得分超第二名 64%
银河通用团队发布仿真测评报告,GPT-6 Astra与π0.5混合架构在 RoboDojo 任务中成功率48%、平均分62.60,超第二名64%。Astra 仅修改**14.4%**的执行控制步骤,主要承担语义理解与修正。
🔶 MiniMax 三款产品纳入新加坡 AI 培训计划
新加坡技能与劳动力发展局推出 AI 课程,MiniMax 旗下 MiniMax Agent、海螺 AI、MiniMax Audio 经 Singtel AI Pass 纳入,学员可获 6 个月免费订阅。
𝕏 Qwen 下载量达 9.42 亿次,中国开源模型占 OpenRouter 调用超 45%
Qwen 在 Hugging Face 下载量达 9.42 亿次,超过其后八家机构总和;中国开源权重模型在 OpenRouter 的 token 占比从不足 2%升至 45% 以上。
𝕏 报道:OpenAI 发布 Astra 前抽调 25% 生产工程师找漏洞
据报道,OpenAI在发布Astra前抽调**25%**的生产工程师,用 Astra 指向自身系统,发现并修复了严重漏洞。
📄 DualSQL:单模型双智能体多智能体 RL,4B 在 BIRD 达 68.0%
DualSQL 用单模型双智能体多智能体 RL 训练,4B 在 BIRD 达 68.0% 执行准确率,8B 升至 71.1%,仅用 3755 条训练样本。
微软 AI 主管苏莱曼炮轰 Anthropic:赋予 AI 类人意识将致失控
微软AI 主管苏莱曼发文批评Anthropic训练 Claude 的方式,警告其“宪法”暗示 AI 可能有功能层面情绪或意识、值得拥有自主权,会创造无法控制的东西,并强调 AI 没有权利、情感或意识。
💻 Anthropic 与 OpenAI 拟在内部嵌入独立安全评估员
Anthropic和OpenAI计划在内部嵌入独立安全评估员,研究人员欢迎这一前所未有的访问权限,但警告有效监督需要透明度、独立性并最终走向监管。
豆包 Doubao-Seed-2.1-pro 更新至 0915 版本,API 全量上线火山方舟
豆包大模型Doubao-Seed-2.1-pro更新至 0915 版本,API 已全量上线火山方舟。本次升级聚焦企业生产级需求,在Agent 任务交付、多模态 Coding、多模态理解及 Token 效率四方面增强。
📄 开放权重 LLM 招聘偏见审计:代理式措辞压低女性推荐分
审计 六款开放权重模型发现:代理式招聘语言压低女性推荐分(r=0.309),编码排斥语抑制非白人候选人。
𝕏 Astra 生成 87 秒 F1 摩纳哥站影片,Codex 编写全部脚本
开发者用 Astra 生成 87 秒 F1 摩纳哥站终圈影片,2,610 帧 4K/30fps 渲染,Codex 编写了 Blender 场景搭建脚本与 Python 引擎声效代码。
𝕏 GPT-6 Astra 仅用代码做出软件宣传视频
用户称GPT-6 Astra从配乐、音效到组件全部自行处理,做出软件宣传视频,未用任何生成模型,纯代码、基于其 Codepilot 组件与设计语言。
📄 免标签偏置微调:仅 10 万参数让 MATH-500 达 76.67%
仅优化约 10 万偏置参数、冻结主干,在 MATH-500 达 76.67%,参数比全参 TTRL 少 7.6 万倍。
📄 AI 辅助写作/编程的时间指纹:仅靠打字节奏即可识别全盘委托
在 CoAuthor、RealHumanEval 等三个语料上,仅用时间特征即可近乎完美识别全盘委托(F1≥0.997)。
📄 实测:AI 生成的 Java 方法 38.4% 未真正计算返回值,正确率仅 12.9%
7,593 个 AI 生成 Java 方法中 38.4% 未真正计算返回值,仅 12.9% 答案正确。
𝕏 Notion 上线开源权重模型 DeepSeek V4.1 Flash
Notion 宣布开源权重模型 DeepSeek V4.1 Flash 已在 Personal 与 Custom Agents 中上线。
𝕏 OpenRouter 上线神秘新模型,约一周免费
OpenRouter上线一款神秘新模型,约一周免费、零数据保留,面向多步任务、工具调用和终端优先工作流,单请求支持256k token。
月之暗面 Kimi 发布金融行业解决方案
月之暗面发布Kimi金融行业解决方案,接入 10 余个数据源、9 项金融技能与 5 项安全合规措施。
🔶 豆包座舱助手正式发布,首搭荣威家越 07
火山引擎发布车载 AI 助手豆包座舱助手,首搭荣威家越 07,上汽奥迪车型年内亮相。
网易有道构建三层 AI 体系,周枫回应 AI 威胁论
网易有道CEO周枫称 AI 核心能力已从单一模型转向“模型+智能体+工作流”的系统能力,公司构建以“子曰”模型为底层、AI Agent 为中间层、办公学习营销为上层 的体系,二季度净收入14.7 亿元。
千问接入人卫医学知识库与 NutriData 营养数据库
千问新增接入人卫医学专业知识库、NutriData营养数据库,用户询问体检指标、疾病知识、日常饮食等时可参考权威医学知识和具体食物成分数据。
Gemini 产品线分化:Flash 四个月四代,Pro 七个月未转正
Gemini产品线分化:Flash四个月连发 3.5 至 3.8 四代且均为Stable,Pro线仍停留在 2 月的 3.1 Preview。
📄 MiST:8B/32B 网络安全专用模型,公开基准较 Qwen 提升 13.1/8.6 个百分点
MiST 8B/32B 网络安全模型以中训练+合成数据,在公开基准上比 Qwen 基线提升 13.1、8.6 个百分点。
𝕏 GPT-6 Astra 自动剪辑 Starship 视频引热议
推文称一段 Starship 视频由 GPT-6 Astra 剪辑生成,展示多模态模型在视频编辑上的能力跃升。
📄 MoRE:相邻层共享专家池的 MoE 变体,同参数预算下困惑度更低
MoRE 让相邻层共享专家池并加深度嵌入,在 114M–1.15B 三个规模上困惑度低于标准 MoE,且改动极小。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。