天眼早报
🤖 AI 大模型
𝕏 ⭐《State of AI Report 2026》发布:AI 开始主导自身研发
State of AI Report 2026 发布:Anthropic 内部 26% 的模型研发由 Claude 主导,Claude Opus 5.5 以 58 分居综合智能指数第一;OpenAI 与 Anthropic 年化收入合计约 1050 亿美元,较年初增长逾两倍。
⭐ 微软发布决策 AI 模型 Microsoft-Decision-1,速度是 GPT-6 Sol 的 35 倍
微软推出专为结构化决策设计的 Microsoft-Decision-1,基于 Qwen3.5-9B 后训练,专做选择题并输出校准概率。其运行速度为 GPT-6 Sol 的 35 倍、Quyet-1.0-Large 的 4.5 倍,在覆盖近 15 万道题的 36 项基准测试中准确率均第一;输入定价每百万 tokens 0.042 美元,输出免费,已在 Microsoft Foundry 上线。Xbox 团队用它归类 1 万多条玩家反馈,快 14 倍、成本低 200 倍。
🔶 ⭐ 谷歌发布企业通用智能体 Gemini Agent
谷歌云在 Gemini at Work 2026 大会推出企业通用智能体 Gemini Agent,用户可用自然语言下达目标,由智能体自主拆解任务、调用企业数据、编写并运行代码、生成文档与多媒体,支持多子智能体协同与四重记忆机制。目前仅面向部分企业用户开放预览,未公布商用日期与定价。
📄 NanoProof:首个完全开源可复现的 Lean 4 定理证明器
NanoProof 在 MiniF2F-Test 达 50.8% pass@16,超越 HyperTree 与 ABEL,算力分别少 90 倍与 7 倍,训练数据、工具链与权重全部开源。
𝕏 ⭐ Claude 推出多 agent 编排功能 dynamic workflows,单次可调度 1000 个 agent
Anthropic 的 ClaudeDevs 宣布 dynamic workflows 进入公开测试:由 lead agent 制定计划,分阶段调度多 agent 并合并结果,单次最多编排 1000 个 agent。实测在 116k 行代码库植入 70 个 bug,workflow 三次均找出 66 个,单 agent 仅 14-27 个。
⭐ OpenAI 推出 Decisions API 公测,比 Responses API 快 10 倍
OpenAI 发布 Decisions API 公测版,将文本/图像转为可分支的结构化类型化答案,速度约为 Responses API 的 10 倍。仅支持 gpt-6-luna 模型(105 万 token 上下文),输入价格每百万 token 0.10 美元,输出免费。
𝕏 ⭐ NVIDIA vLLM 推理方案 Rubin:每吉瓦利润提升 3.2 倍
SemiAnalysis 测算,NVIDIA Vera Rubin NVL72 在 vLLM 上每吉瓦利润比 GB300 NVL72 高 3.2 倍,每美元性能最高提升 10 倍,运行开源模型年利润可达 390 亿美元。
💻 ⭐ 非文本 AI 模型 Jev 发布数周即估值 75 亿美元
TypeSafe 的非文本 AI 模型 Jev 发布仅数周即估值 75 亿美元,公司称其运行速度显著更快、使用 token 远少于 LLM,已获用户和大型企业关注,a16z 参与投资。
𝕏 ⭐ 阶跃星辰 Step 5 Preview 发布,登顶 OpenRouter 趋势榜
StepFun 发布 Step 5 Preview,采用 600B 总参数、27B 激活的稀疏 MoE,原生支持文本、图片、视频输入与 100 万 token 上下文,主打代码 Agent 与前端生成,智能分 44 与 GLM 5.3、Kimi K3 相当,输入输出价格仅 $1.0/$2.70 每百万 token;开源权重将于 10 月 15 日发布,上线次日即登顶 OpenRouter Trending 榜首。
𝕏 Prime Agent 用 2000+ 智能体集群两周重写自身为 Rust
PrimeIntellect 的 Prime Agent 通过 2000 多个 子智能体、10000+ 沙盒、2000 亿+ GLM-5.3 token 和 16000 条智能体间消息,用两周将自身重写为 Rust。新版输入可用速度提升约 13 倍,启动内存减少 83%,已开源。
🔶 谷歌 Gemini 4 Argon 已对部分用户开放,最快今日发布
Gemini 4 Argon 已现身 Google Cloud、编程工具 Antigravity(被设为默认模型)并被曝在代码库直接提交代码;发布卡片已部署于内部系统与部分 Pro 用户界面,爆料与媒体报道指向本周甚至数小时内正式发布。
𝕏 ⭐ 谷歌一周密集发布:Nano Banana 2.1、EmbeddingGemma 2 等多个模型
谷歌本周发布多项更新:Nano Banana 2.1 提升视觉设计、主体一致性与精确局部编辑;EmbeddingGemma 2 为首个原生多模态开放嵌入模型,统一文本、图像、视频、音频与代码;Gemma 4 用于作物基因研究。
📄 研究:LLM 版本迭代导致 AI 写作检测器大面积失效
研究将 PNAS 4000 篇摘要交由 23 个版本 LLM 改写,检测器在模型代际边界处检出率从 99% 骤降至 3.8%,呼吁每次模型发布后重新验证检测器。
📄 ReSI:递归安全改进框架,攻击成功率从 86% 降至 31%
ReSI 通过多轮红队评估与自动更新对齐模型,将四个模型的 X-Teaming 攻击成功率 从 86.01% 降至 31.45%,低于前沿模型的 56.69%。
📄 SWE-Journey:编程助手评测新基准,非程序员场景通过率不足 25%
新基准 SWE-Journey 引入用户模拟,模型面对软件架构师通过率超 75%,面对非程序员却不足 25%,暴露问对、找对、修对的能力缺口。
𝕏 阿里发布 Qwen-Image-2.1-Turbo,8 步去噪生成 2K 图像
阿里 Qwen 团队发布 Qwen-Image-2.1-Turbo,将图像生成与编辑的去噪步数从 40 步降至 8 步,保持 7B 架构与 2K 输出,并支持自然语言编辑,开放权重已上线 ModelScope 与 Hugging Face,Pro 与 Turbo API 正式可用,采用研究许可证。
𝕏 HuggingFace TRL v1.15 发布:峰值显存降低 82%、序列长度延长 7 倍
HuggingFace TRL v1.15 发布,默认启用融合 LM head,峰值显存降低最多 82%,序列长度延长 7 倍,DPO 从 10k 升至 59k tokens,GRPO 升至 115k。
GPT 周报:Meta 等联合起草个人智能体协议,Manus 融资超 5 亿美元
Meta 与 Sierra 等企业联合开发 个人智能体协议,规范智能体与企业交互;Manus 完成超 5 亿美元新一轮融资;另有数学组织反对 OpenAI 发布数学研究成果。
📄 LTBD:可学习信任边界防御提示注入,攻击成功率降至 0
轻量防御 LTBD 用少量可学习分隔符区分可信指令与不可信数据,在 AlpacaFarm 上 ASR 为 0.00%,TaskTracker 仅 0.11%–0.19%,且无需微调模型。
📄 研究:编码 Agent 的技能冲突普遍存在,近四分之一技能重复
分析 20,947 个代码仓库发现,近 1/4 已安装技能存在功能重复;冲突不改任务通过率,却令核心功能丢失超 1/3,建议平台在首次读取时拦截。
📄 研究揭示 LLM 评判不可靠:重复试验结论会翻转
对 6 个前沿模型审计发现,温度 0 下重复试验结论仍会变化,位置顺序调换可翻转多数判定,最确定的评判者仅 51% 与真实答案一致。
𝕏 Meta 超级智能实验室提出“智能体可塑性”指标评估自改进收益
Meta 超级智能实验室提出agent plasticity(智能体可塑性),即模型权重冻结、每次运行全新上下文时,每美元学习成本带来的留出任务收益。研究发现表现最好的模型往往不是学习最高效的:国际象棋、围棋中Claude Fable 5最终分最高,而 GPT-5.6 Sol 每美元增益最大;NetHack 中仅 Claude Opus 5.5 显著提升。
𝕏 Qwen3.8-Flash-Next 与 GLM-5.3-Flash 稀疏架构对比实测
实测显示同款 4090 48G 机器上,Qwen3.8-Flash-Next 达 120 tok/s,GLM-5.3-Flash 为 40 tok/s,比值与激活参数 18B 比 6B 一致,源于极稀疏专家架构。
📄 DIAL-OPD:仅用 40% token 的在线蒸馏,AIME25 通过率翻倍
DIAL-OPD 按学习价值筛选 token,仅保留 40% 即超越全 token 蒸馏,平均准确率提升 5.25 个百分点,AIME25 Pass@16 从 13.33% 升至 26.67%。
📄 研究首次将冻结决策模型 Jev 引入强化学习训练
研究将冻结决策模型 Jev 用作参考策略、探索评判与回放评分,在 9 个 MiniGrid 任务 与 3 款 Atari 游戏 上超越标准 RL 学习器,Jev 本身无需训练。
📄 新基准:LLM 生成 UI 设计创意度远低于人类
Design Creativity Bench 测出模型同提示设计的原创性仅 0.592,远低于人机配对的 0.764;创意跨度 0.581,而人类设计达 0.902。
𝕏 Tinker 将长上下文 token 价格降至与短上下文相同
Tinker 将长上下文 prefill 与采样价格降至与短上下文相同,agent RL 中占大头的 token 成本大幅下降,长上下文任务的训练与评测因此更便宜。
📄 Agentic-TTT:让模型自主决定何时进行测试时训练
Agentic-TTT 把测试时训练(TTT)流程转为可调用工具,学习策略判断何时启用,在自有基准上效用较主干模型提升近一倍,并能权衡算力。
AWS、Upstage、Ollama 就决策模型 API 达成一致,OpenAI 未加入
AWS 发布基于阿里 Qwen3.5 的开源权重模型 Strands Decider 2B,采用与 TypeSafe AI 的 Jev 相同的 /v1/systemone 端点,Upstage、Ollama 跟进,OpenAI 未签署。
𝕏 LangSmith 信号:Claude Sonnet 5 采用率跃升至第 2,GPT 5.6 Luna 调用量登顶
LangChain 发布 LangSmith Signals:Claude Sonnet 5 模型采用率从第 9 升至第 2,使用机构增加 51%;gpt 5.6 luna 调用量从第 3 升至第 1,增加 65%。
Cloudflare 发布 Clef-omni 全模态决策模型
Cloudflare 发布 Clef-omni 决策模型,可同时接收音频(wav/mp3)、视频(mp4/webm)、图像与文本输入,无需级联转写管道,同时下调 Clef-flash 价格并提升 Clef 速度。
𝕏 Grok Bot 获得专属邮箱,可自主注册与对外联络
xAI 为 Grok Bot 开放专属邮箱,每个账户限申请一个,可自主注册服务、联系商家、安排会议,相当于为 AI 助理配备独立收件箱。有测试者称已通过它管理约 90% 的编码工作。
📄 研究:本地开源 LLM Agent 可完成 85% 数据工程任务
15 项移动性数据工程任务基准显示,闭环工作区使通过率提升 26.7–52.0 个百分点,最强配置达 85.3%,量化 90 亿参数模型达 69.3% 且仅需约 6.5GB 显存。
𝕏 Claude Code Projects 即将向 Pro 和 Max 用户开放
Anthropic 将为 Claude Code 推出 Projects 功能,用户只需一次设置指令、仓库和记忆,即可批量分配任务,由 Claude 以并行云线程运行,Overview 面板显示哪些线程完成、哪些 PR 待审。
𝕏 Kimi K3 在 AMD MI355X 上跑出 216 tok/s
Kimi K3 在 AMD Instinct MI355X 上由 TokenSpeed 驱动,8 卡配置下每用户输出 216 tok/s,解码速度达 ATOM 的 1.4 倍,且在更真实的多轮 SWE 任务上测得。
📄 研究:LLM 生成的无代码修复不到半数真正解决问题
在 322 条 无代码修复中,不同执行器仅 14.6%–49.7% 真正解决 bug,最优配置达 74.1%;仅更换执行器就使解决率平均波动 38.8%。
𝕏 Meta 首席 AI 官披露 Muse 运行于独立安全虚拟机
Meta 首席 AI 官 Alexandr Wang 介绍,每个 Muse 运行于独立沙盒 安全 VM,数据仅存其中;sentinel agent 会拦截信用卡、社保号等敏感信息外发,访问新网站需用户逐一批准。
𝕏 英伟达在 Hugging Face 发布 GR00T 机器人模型 Agile One S
英伟达发布基于 GR00T 的机器人模型 Agile One S,面向 SSD 分拣部署场景,附带 ONNX 计算图与 TensorRT 引擎。
𝕏 Arena 周榜:Nano Banana 2.1 跻身图像三榜前六
Nano Banana 2.1 在 Image Arena 三种模式均进入前六:多图编辑第 4(1431 分)、文生图第 5(1328 分)、图像编辑第 6(1428 分);Mistral Large 4 位列 Agent Arena 第 43 名。
Mistral Large 4 合规性大幅提升但仍有差距
Mistral 新模型 Large 4 在欧盟 AI 法案与 GDPR 合规测试中从 16% 升至 53%,人权场景表现提升 61 个百分点,但仍落后于 Claude 与 GPT 模型。
𝕏 Codex 新增 composer 预测功能
OpenAI 为 Codex 桌面应用 Pro 用户推出 composer 预测(beta),可根据对话内容建议下一条消息,按 Tab 接受,可在设置中关闭。
𝕏 Claude 新增 Dashboards 与 Motion 功能
Claude 新增两大能力:用自然语言构建实时 Dashboards,以及将一句提示词转为发布视频、广告和动画解说的 Motion 功能。
𝕏 Chrome 集成 Gemini 支持从学习资料生成练习题
Google Chrome 集成 Gemini 推出考试备考功能,可从学习资料创建 练习题,该更新正在推送中。
𝕏 LangChain 为托管 Deep Agents 简化认证、记忆与渠道
LangChain 简化了 Managed Deep Agents 的智能体认证、记忆与渠道,并将网络搜索作为预置工具引入,相关细节在 Interrupt NYC 会议公布。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。