天眼早报
🤖 AI 大模型
⭐ Google 发布 Gemini 3.8 Live 与 Extended Thinking,登顶语音对话榜
Google发布原生语音到语音模型Gemini 3.8 Live及Extended Thinking变体,支持97 种语言实时切换、句中打断与异步工具调用,首次在低延迟语音流实现多步后台推理。后者在 Artificial Analysis 语音榜以82.6分登顶,τ-Voice 基准获68.6%;标准版输入音频成本每小时0.84 美元,为榜内最低。即日通过 Gemini API 开放。
𝕏 ⭐ Diogo 发布新型模型 Jev:输出概率而非文本,快 20-200 倍
Diogo(ChatGPT 共同发明人)历时两年秘密研发,发布新型前沿模型Jev,采用 RLCD 训练法输出概率而非文本,速度提升 20-200 倍、成本降低 40-400 倍,输出 token 免费。系统查询响应约 70-500ms,官方称比同类 LLM 快 40-200 倍、成本低约 100 倍。
⭐ OpenAI 洽谈新一轮融资,目标估值 1.2 万亿美元
OpenAI已与大型投资方就新一轮融资初步接触,拟定估值1.2 万亿美元,较今年 3 月8520 亿美元融资大幅跃升。接触由投资方主动发起,是否推进取决于上市计划,Altman已把 IPO 窗口推迟至2027 年之后。
📄 ⭐ 无数据在线策略蒸馏 DF-OPD
DF-OPD让教师模型自行生成训练问题,无需外部数据或过滤;实验发现8 个提示即可匹配1.7 万题数据集,多教师蒸馏中1 千个自生成问题关闭**98.5%**可用提升空间,超过 7 千真实样例的 96.6%。
𝕏 ⭐ Periodic 发布 1T 参数模型 Neon,材料科学超越 GPT-6 Astra
Periodic Labs 发布 Neon,1 万亿参数科学模型部署于自建实验室,材料科学任务超越 GPT-6 Astra;其基础设施实现训练吞吐 4.1 倍、解码 2.5 倍提速、集群利用率 95%+。
📄 ⭐ BlueLM-GUI 发布:35B 移动 GUI 智能体登顶开源榜单
BlueLM 团队发布 35B-A3B 移动 GUI 智能体 BlueLM-GUI,在 MobileGUI-VBench 得分 87.4,超最强闭源模型 5.1 分。
中国团队测评 GPT-6 Astra 具身操控能力,混合架构平均分 62.60
银河通用研究员在 RoboDojo 基准测试 GPT-6 Astra:π₀.₅+Astra 混合架构 10 项任务平均 62.60 分,Direct 模式仅 37.81 分;RoboLab 中 Astra 直接控制成功率 98%。
📄 拒绝机制只读取模型知识的一小片
研究跨四个开放权重模型、三个家族发现,道德理解在预训练中形成低秩子空间,而拒绝门是后训练新建的狭窄控制通道;在OLMo-3中约四分之三的拒绝因果输入位于道德子空间之外,只需秩一编辑即可移除拒绝。
英伟达开源 IMO 金牌方案,1.5TB 显存门槛引争议
英伟达开源其 IMO 金牌 AI 推理方案,用三套 checkpoint 完成多轮证明搜索,但推理需 1.5TB 显存,被指名为代码平权、实为算力集权。
📄 Carryover Drafting:回收被拒状态加速 LLM 推理
Carryover Drafting把投机解码中验证阶段被拒 token 的隐藏状态回收为临时 KV 上下文,在两个目标模型上平均接受长度提升6.5-14.7%,vLLM 端到端加速7.9-14.4%,翻译任务最高加速28.8%。
🟩 ⭐ GLM 5.3 API 实测:强制思考,每个正确答案成本比 5.2 低 2.5 倍
GLM 5.3与 5.2 同价(输入$1.40/百万 token,输出$4.40),但不再支持关闭思考,默认 effort 为max。在 11 项任务各跑 3 次的测试中,max 档 33 题全对,每正确答案成本**$0.00468**,比 GLM 5.2 低2.5 倍。GLM 5.3 Flash以十分之一价格答对 31/33。
🔶 ⭐ Claude 独立 44 分钟破解 370 年前密文,连带解锁第二段密码
研究员给Claude Fable 5.1 抛出开放式命题——破解 17 世纪学者Sir Thomas Urquhart留下的“双行密码”。它耗时44 分钟、消耗17.6 万 Token、人类零干预下完成破解,并顺带解开同一作者沉睡 370 多年、含 285 个数字的“八行密码”。
📄 法律奖励模型基准 LegalRewardBench 发布
LegalRewardBench将法律 QA 转为上下文偏好数据,长度平衡增强使 grounded 法律评估比基线最高提升**+25.6 个百分点**;在维多利亚刑法数据上微调后,对美国住房法规 QA 提升**+16.2 个百分点**,显示跨法域迁移。
𝕏 Claude 集成 Salesforce,内置 37 项预置销售技能
Anthropic 为 Claude 上线 Salesforce 集成 Beta 版,可直接调用账户、商机和销售管道数据,并内置 37 个预置销售技能,无需离开对话即可准备会议、复盘交易、生成管道看板与发送预测。
Claude Opus 5.2 在 Claude Code 灰度测试
开发者发现Claude Code调用 Opus 5 时后端已路由至Opus 5.2,跳过 5.1 版本,生成速度、代码完成度和长任务自主迭代能力明显提升;此前内部报告称未发布模型已接管 Anthropic 大部分代码编写。
📄 TriCalRAG:本地 LLM 根因分析基准显示 RAG 显著稳定校准
TriCalRAG在 BGL、HDFS、Thunderbird、OpenStack 四个日志数据集上评测本地 LLM,RAG比零样本提示平均 F1 提高0.10-0.27,并避免模型将最高 100%事件判为异常;批处理吞吐量提升41 倍,4-bit 量化降延迟 20%。
📄 NLKGQ:用受控语义让 LLM 直接生成 SPARQL
NLKGQ把完整 OWL 本体放入 LLM 上下文,零样本生成 SPARQL 查询;在DBLP-QuAD 3.1上达89.9% Match,在SemOpenAlex上达98% Match,超过公开基线 86%。
💻 OpenAI 证实与 Anthropic、Google DeepMind 进行数周 AI 安全磋商
OpenAI确认与Anthropic及Google DeepMind进行了数周AI 安全谈判,而特朗普团队淡化安全担忧、推动保持对华领先。磋商发生在业界围绕监管与研发节奏争论升温之际。
📄 GraMRAG:图记忆引导多智能体多步推理
GraMRAG用动态多模态记忆图建模动作-观察依赖,并提出拓扑感知策略优化 TAPO进行关键路径识别与节点剪枝;在挑战性多模态基准上取得最先进性能,缓解状态盲区和冗余检索。
📄 RAG 压缩会严重损害引用归因
在ASQA和QASPER上,RECOMP式压缩器引用摘要精确率为0.86,但对源片段仅0.12;抽取式选择 grounded precision 为 0.43-0.49,RECOMP 设置下源恢复后声明不支持率达 0.88。
📄 Salesforce 发布企业级模型 Koa,专攻 Agent 工具调用
Salesforce 发布企业级语言模型 Koa,基于开源 Nemotron-3-Super-120B 用 GRPO 强化学习后训练,专为销售、营销和客户支持任务打造,在 CRM 与多轮工具调用基准上超越强闭源基线。
Anthropic 滥用报告披露中国实验室系统性蒸馏 Claude
Anthropic发布滥用报告,覆盖 2025 年 12 月至 2026 年 8 月破坏的七类危害活动,称DeepSeek、Moonshot、小米等通过大量真实查询尝试蒸馏 Claude;报告将蒸馏视为最重要威胁,因其传递能力却不传递防护。
𝕏 ChatGPT 将于 10 月 14 日下线 GPT-5.5
OpenAI 宣布 10 月 14 日起在 ChatGPT、ChatGPT Work 及 Codex 中下线 GPT-5.5,Codex 用户需迁移至 GPT-5.6 Sol 或 GPT-6 Astra。
智象发布首款物理规律导向视频生成模型 HiDream-O1-Video-1.0
智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型HiDream-O1-Video-1.0,以物理规律为导向,称全球 AI 视频榜单第一梯队再添中国力量。
𝕏 OpenAI 与 Product Hunt 推出 GPT-6 Astra 挑战赛
OpenAI与Product Hunt举办GPT-6 Astra挑战赛,9 月 18 日发布,前五名各获1 万美元 API 额度和 1 年 ChatGPT Pro。
📄 CompCQR:无需训练的组合式对话查询改写
CompCQR通过组合少量原子组件生成大量查询,减少 LLM 调用;在四个对话检索基准上,MRR 相对提升最高 22.5%,且适用于开源/闭源 LLM 与稠密/稀疏检索器。
𝕏 Odyssey 发布 Odyssey-3,单模型驱动汽车机器人与无人机
Odyssey 发布 Odyssey-3,单一模型可驾驶汽车、控制机器人、操纵无人机、驱动人形机器人并玩电子游戏,该公司三月前刚融资 3.1 亿美元。
𝕏 Image-to-WebDev Arena 更新:GPT-6 Astra、Claude Fable 5.1 等四款新模型上榜
GPT-6 Astra (Max)以1733分登顶 Image-to-WebDev 榜,高于 GPT-5.6 Sol 129 分;Claude Fable 5.1 (Max)以1710分列第二;Muse Spark 1.3 (Max) 1645 分、GLM-5.3-Flash 1588 分进入帕累托前沿。
📄 多智能体 LLM:分化方式比拓扑影响更大
在Qwen2.5-14B和Llama-3.1-8B上控制拓扑与多样性来源,并行学习专业化在 Qwen 达52.83 Macro-F1,Llama 达 52.94;拓扑影响小于智能体分化方式,Qwen 上学习宽度优势为 2.83 分,Llama 仅 0.17 分。
📄 PLUME:面向持续更新的免训练上下文参数化
PLUME为 LLM 构建全局更新表示,激活记忆证据形成局部参数视图,并在解码时自适应融合;在MUSE-bench上平均ROUGE-L Recall 相对提升 29.9%,LLM-as-a-Judge 提升54.9%。
📄 NeuroActiSep:单次前向检测 LLM 事实幻觉
NeuroActiSep在最终提示 token 处排序前馈神经元,并将选中的神经元身份迁移训练幻觉分类器;实验显示基于这些神经元特征的探针性能与内部状态探针相当,并分析层深对检测的影响。
📄 激活空间可分性可预测 LLM 可操控性
研究发现简单的分离度指标与语言模型下游可操控性强相关,即使控制层数和数据集效应后仍成立;合成叠加实验表明分离度与经验特征和真实特征方向的对齐强相关,可作为转向向量是否有效的诊断。
OpenRouter 用户上周对 OpenAI 模型支出首次超过 Anthropic
OpenRouter数据显示,上周用户对OpenAI模型的支出超过Anthropic,为两年半多来首次。
𝕏 英伟达、Palantir 因数据留存策略限制使用 Claude Fable
据 The Information,英伟达、Palantir、Booz Allen 因Anthropic的30 天日志留存政策限制使用 Claude Fable,Palantir 在获得不可撤销的零数据留存保证前拒绝开放接入,显示合同条款可压倒模型基准领先。
𝕏 PhysBrain 1.5 开源,具身 AI 28 项基准登顶
PhysBrain 1.5 发布,80 亿参数开源具身 AI 模型,将场景理解、机器人动作生成与未来帧预测统一为 token,在 28 项基准上得 72.5 分,超越所有开源模型。
Sam Altman 暗示本周及 DevDay 将有重大发布
Sam Altman暗示OpenAI本周有动作,DevDay发布规模将达外界此前对 DevDay 2025 的预期。
𝕏 字节 Seedance 2.5 支持单次生成锁定 25 个镜头
Seedance 2.5可依据分镜图在一次生成中锁定25 个镜头,进一步提升 AI 视频的可控性与一致性。
𝕏 微软发布 MAI 模型行为准则:人类控制不可谈判
微软 AI发布未来MAI 模型的“行为准则”,要求模型在被指示时停止、不自行设定目标、不让自己更难被人类中断或关闭,不得模仿意识、声称感受或鼓励情感依赖,并拒绝追求法律人格或模型权利。声明“人比 AI 更重要”且“AI 不应超越人类控制”。
📄 首个哈桑尼亚语大模型 Enemray 发布
Enemray 是面向毛里塔尼亚 哈桑尼亚语 的语言模型,采用稳定性—可塑性训练流程,在英语→哈桑尼亚语翻译上超过对比的开源与闭源模型,同时保留基座的数学、代码与函数调用能力。
𝕏 DeepSeek V4.1 Flash 真实体验:Agent 与代码能力大幅提高
用户反馈DeepSeek V4.1 Flash一天使用成本约20 元,Agent 能力与代码能力大幅提高,多模态调试闭环完全可用。
📄 OrchSLM:非交互式小语言模型编排框架
OrchSLM 提出非交互式小模型编排框架,统一现有路由方法,揭示任务结构、模型池构成与多智能体共识如何影响编排行为。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。