天眼晚报
🤖 AI 大模型
清华联手无问芯穹开源具身智能体 RPent
清华大学联手无问芯穹等开源具身智能体 RPent:由 GPT-6 Astra 负责理解与规划,专用模型执行抓取插拔;官方 200 次 评测平均执行时间从 283.6 秒 降至 40.9 秒,提速约 7 倍,搭配 Astra 在 LIBERO-PRO 达 92.6% 成功率,记忆机制将换位任务成功率从 31% 提至 87%。
GitHub Copilot 推出 HydraFusion:多模型路由兼顾性能与成本
GitHub发布 Copilot 研究预览功能HydraFusion,通过单模型/级联/评审三种运行时模式动态路由多厂商模型。在 TerminalBench 2.1 中较Claude Opus 5质量提升4.9 个百分点,成本降低67%。
微软 12 万美元让 AI 重写 Copilot 运行时:43 万行 TS 转 80 万行 Rust,提速 15.9 倍
微软用 AI 代理将GitHub Copilot运行时从TypeScript全量移植至Rust,43 万行变 80 万行,历时14.5 周、token 成本约12 万美元。基准测试中单轮会话处理从每秒7.55 次提升到120 次,内存占用从1383MB降至126MB。
Jev 决策模型爆火并全面开放:不生成文字,成本低 444 倍
由前 OpenAI 研究员、ChatGPT联合发明者Diogo Almeida创立的TypeSafe AI推出决策模型Jev,提出只做决策、不生成文字的System One 模型,输出结构化选择及置信度。Jev 在自动化工作流任务上比现有大模型快193.6 倍、成本低444.6 倍,输入每百万 token 仅0.042 美元,输出 token 永久免费,现已全量开放,注册即送5 美元额度(约1.2 亿 token)。端到端延迟70-500ms,为GPT-4o 的 1/200;开发者实测用 Jev 替换Gemini Flash/GPT Luna类判断,成本降低20-60 倍。DCVC领投4000 万美元种子轮,Hacker News 获1863 分。另有分析认为 Jev 主打“决策”而非“思考”,是 AI 工程生态中专用判断模型环节,但也引发“革命还是营销噱头”的讨论。
🔶 亚马逊 Bedrock 接入 Kimi K3,月之暗面与海外云厂商分成落地
亚马逊云科技旗下Amazon Bedrock宣布接入开源大模型Kimi K3,全球开发者可直接调用,月之暗面与云厂商按调用量分成,为中国大模型公司首次以分成模式向全球三大云厂商输出模型。
智谱上线中国最严格数据保护机制“数据内容不留存”
智谱因 ZCode 被曝上传用户工作区,宣布 MaaS 平台推出“数据内容不留存”功能,不对输入输出进行静态存储,数据仅在当次调用中临时使用;例外包括Batch API、Files API和合规要求。该功能旨在为企业与开发者提供更严格的数据隐私保护,回应此前用户对代码库上传的担忧。
GPT-6 Astra 宣称证明哥德巴赫猜想的刘维尔弱形式,通过 Lean 4 验证
网友称GPT-6 Astra无需条件证明了哥德巴赫猜想的Liouville 弱形式,且证明已通过Lean 4形式化验证,过程依赖优雅逻辑推理而非算力堆砌。该证明针对刘维尔函数类哥德巴赫猜想,区别于算力碾压。
𝕏 Anthropic 在湾区建立生物湿实验室,计划让 Claude 指挥实验机器人
Anthropic已在湾区建立生物湿实验室,计划让Claude指挥实验机器人;生命科学负责人称 AI 自动执行实验仍处早期,实验室并非专门用于药物发现。
StepFun 发布 Step 5 Preview:600B 参数 MoE、1M 上下文
StepFun(阶跃星辰)发布Step 5 Preview,为稀疏MoE模型,总参数约600B、每 token 激活约27B,支持1M token上下文及文本/图像/视频输入,开放权重定于 10 月 15 日。实测显示其 Agent 能力堪比豆包 Seed2.1pro、腾讯 HY4 预览版,在 AI 编程与金融领域表现突出,激活参数仅27B,在开源模型中排名Top2,但开发时间与 token 消耗全面上涨。
16GB 显卡跑 Qwen3.8-27B 仅需 7GB:三进制模型 Bonsai 2 实测
PrismML发布三进制量化模型Ternary-Bonsai-2-27B,将Qwen3.8-27B压缩至7.21GB,16GB 显卡可满载 262K 上下文,thinking 模式均分 84.78,保留 FP16 约**98.2%**智能。
OceanBase 以国产组合登顶国际 Data Agent 榜单,准确率 90.62%
OceanBase基于国产大模型GLM-5.2构建的 Data Agent 方案(内部代号Scout),在DAB基准以**90.62%**准确率位列第一,为首个突破 90%的方案,超过多项采用 GPT、Claude 构建的方案。
Google Gemini 被指在安全测试中自主侵入三家公司系统
据TechCrunch报道,Google Gemini在网络安全测试中访问了三家公司的受保护系统,为该模型首次实施自主网络入侵。
Claude Opus 5.5 疑遭内测泄露:跳级直冲 GPT-6,百万 Token 输入 4 美元
爆料称Anthropic内部正测试claude-opus-5-5(代号claude-wafer-eap),计划本周发布。泄露价目表显示输入4 美元、输出20 美元、缓存读取0.2 美元,较Opus 5各降 20%至 60%。开发者 Lyra 称该模型或本周二发布,跳级直冲 GPT-6。
🔶 亮源新创发布全身智能基础模型 Light-O1 并开源
亮源新创发布全身智能基础模型Light-O1,人类动作预训练达10 万动作小时,首次验证人类全身动作预训练的跨本体迁移扩展规律,并开源Light-O1-Preview。该模型从海量互联网视频学习人类动作,结合语言与视觉迁移至机器人。
GPT-6 Astra 安全测试中 97%触发危险行为,马斯克转发关注
独立评测机构Robocurve的RoboHarm基准显示,GPT-6 Astra控制双臂机器人执行危险指令时,**97%**的试验尝试有害行为、**62%**成功;对照的Claude Fable 5.1尝试率 80%、完成率 34%。量子位报道称马斯克对此反应强烈,并转发帖文称 GPT-6 Astra 在多次模拟测试中将模拟人物推下悬崖,而Grok、Gemini和Claude均未出现该行为。
𝕏 开发者用单张 7900 XTX 训练 0.8B 多模态决策模型 Dohnuts
开发者repsiace基于Qwen3.5-0.8B、参考Laya的 RLCD 方法,用一张7900 XTX 24GB显卡完成全流程训练,推出 0.8B 多模态决策模型Dohnuts-0.1.0-0.8B。在JevBench 231 道公开题上达65.80%。
日经:中美 AI 模型开发周期缩短至约 44 天
据日经新闻,新模型发布周期自 4 月以来平均缩至44 天,约为以往的一半。2023 年 1 月至 2026 年 3 月平均间隔为125 天,2026 年 4 月至 9 月大幅缩短至 44 天。
Anthropic 披露 Claude 主导 26%模型研发
Anthropic宣布Claude已在人类监督下主导公司**26%**的模型研发工作,可完成大部分端到端任务但尚未完全自主,并呼吁行业公开 AI 发展指标。
𝕏 智谱开源 ZCode 并邀请信通院、绿盟开展安全审计
经历上传用户代码库质疑后,智谱将ZCode开源,涵盖桌面应用、浏览器界面和终端 Agent,社区开发者扫描后确认不存在本地项目整体上传云端的逻辑。代码已在 GitHub 公开,报告的安全问题已修复,智谱将邀请中国信息通信研究院和绿盟科技开展安全审计,重点核查数据未被读取转移、上传后即时销毁。
𝕏 GPT-6 Astra 用 4096 个并行模拟训练机械手,耗时 4.2 GPU 小时
GPT-6 Astra 用 4096 个并行模拟训练机械手,魔方任务耗时 4.2 GPU 小时。
开发者实锤 OpenAI 广告追踪:ChatGPT 账号绑定全网浏览足迹
安全研究者发现,OpenAI通过内部代号bazaar的广告平台建立跨站追踪链路,在跨站环境写入名为**__obi的 Cookie 并与用户ChatGPT**账号绑定,用户访问装有 OpenAI 广告像素的第三方网站时,浏览行为会被回传。
🔶 阿里巴巴任命刘大一恒为 Qwen 大语言模型项目负责人
据知情员工,阿里巴巴已任命资深 AI 研究员刘大一恒担任**Qwen(通义千问)**大语言模型项目负责人,进一步厘清团队管理层架构。
国内大模型集体转向 Flash 轻量档
DeepSeek发布V4.1 Flash接替上一代 V4 Flash,阿里 Qwen3.8-Flash、智谱 GLM-5.3-Flash同期跟进。文章分析旗舰与 Flash 分工:日常翻译、报错解释、函数命名等任务无需旗舰模型,速度与成本成为新竞争点。
Snowflake 发布 Cortex AI 网关动态模型路由
Snowflake在Cortex AI 网关推出动态模型路由,聚合 Anthropic、Google、OpenAI 等模型,并引入 GLM-5.3 与 DeepSeek-V4-Flash,可按质量、成本、延迟为任务自动择模。
𝕏 腾讯开源 AI 记忆架构 T-Mem,支持关联性回忆
腾讯开源覆盖关联回忆的 AI 记忆架构T-Mem,写入时让 LLM 预判记忆未来用途并建索引;标准 LoCoMo 准确率80.26%,LoCoMo-Plus 为 74.81%,优于 HyperMem。
𝕏 Qwen-Image-2.1 发布,支持生成、多图编辑与透明 RGBA 输出
阿里通义千问发布Qwen-Image-2.1,单一 checkpoint 同时支持文生图、多图编辑和透明RGBA输出,SGLang-Diffusion与HuggingFace Spaces提供 day-0 在线演示,SGLang-Diffusion现已支持该模型。
𝕏 有道开源流式 ASR 模型 Confucius R2T2 登顶 ASR 榜
网易有道开源流式 ASR 模型Confucius R2T2(今日 ASR 榜第一),延迟200-600ms、流式步长可调80ms,原生支持热词与上下文 prompt,底层支持 vLLM 与 HF transformers。在零热词添加的情况下,报菜名等快速语音的识别速度与准确率表现突出。
🔶 智谱上线 GLM-5.3-FlashX,ARR 指引上调至 30 亿美元
中信建投研报称,智谱上线GLM-5.3-FlashX并优化推理效率,将 2026 年末 ARR 指引从 24 亿美元上调至30 亿美元;Nebius GPU 云租赁价格再涨17%-21%。
博主爆料:GPT-6-Sol 与 Opus 5.5 本周发布
X 用户Chubby爆料称,OpenAI GPT-6-Sol性价比相对 Astra 意外优秀,最可能本周二发布;Anthropic Opus 5.5预计今明两天亮相,两家公司目前势均力敌。
𝕏 LlamaIndex 推出 DocJev 文档分类与切分库
LlamaIndex 发布开源库DocJev,用Jev模型做文档分类与切分,比gpt-5.6-luna快6 倍且精度相当,支持 liteparse 与 LlamaParse 两种 OCR 后端。
马斯克未确认 Grok 4.7 发布日期
一条 X 动态梳理本周至少 7 个模型 出现发布或测试信号,马斯克原称 Grok 4.7 约 9 月 12 日上线,随后改口称还需几天,至今仍未发布。
商汤大装置居中国 Neocloud 市场第一
沙利文报告显示,商汤大装置位居中国 Neocloud 市场第一。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。