09月16日 · 科技早报

天眼早报

科技|2026年09月16日|250 分钟阅读
来源:963 条推文 + 1060 篇 RSS 文章·Lanyun·BatchV2 生成·2026-09-15 — 2026-09-16
分享
AI 速读18 条精选

🤖 AI 大模型

⭐ Google 发布 Gemini 3.8 Live 与 Extended Thinking,登顶语音对话榜

Google发布原生语音到语音模型Gemini 3.8 LiveExtended Thinking变体,支持97 种语言实时切换、句中打断与异步工具调用,首次在低延迟语音流实现多步后台推理。后者在 Artificial Analysis 语音榜以82.6分登顶,τ-Voice 基准获68.6%;标准版输入音频成本每小时0.84 美元,为榜内最低。即日通过 Gemini API 开放。

𝕏 ⭐ Diogo 发布新型模型 Jev:输出概率而非文本,快 20-200 倍

Diogo(ChatGPT 共同发明人)历时两年秘密研发,发布新型前沿模型Jev,采用 RLCD 训练法输出概率而非文本,速度提升 20-200 倍、成本降低 40-400 倍,输出 token 免费。系统查询响应约 70-500ms,官方称比同类 LLM 快 40-200 倍、成本低约 100 倍。

⭐ OpenAI 洽谈新一轮融资,目标估值 1.2 万亿美元

OpenAI已与大型投资方就新一轮融资初步接触,拟定估值1.2 万亿美元,较今年 3 月8520 亿美元融资大幅跃升。接触由投资方主动发起,是否推进取决于上市计划,Altman已把 IPO 窗口推迟至2027 年之后

📄 ⭐ 无数据在线策略蒸馏 DF-OPD

DF-OPD让教师模型自行生成训练问题,无需外部数据或过滤;实验发现8 个提示即可匹配1.7 万题数据集,多教师蒸馏中1 千个自生成问题关闭**98.5%**可用提升空间,超过 7 千真实样例的 96.6%。

𝕏 ⭐ Periodic 发布 1T 参数模型 Neon,材料科学超越 GPT-6 Astra

Periodic Labs 发布 Neon,1 万亿参数科学模型部署于自建实验室,材料科学任务超越 GPT-6 Astra;其基础设施实现训练吞吐 4.1 倍、解码 2.5 倍提速、集群利用率 95%+

📄 ⭐ BlueLM-GUI 发布:35B 移动 GUI 智能体登顶开源榜单

BlueLM 团队发布 35B-A3B 移动 GUI 智能体 BlueLM-GUIMobileGUI-VBench 得分 87.4,超最强闭源模型 5.1 分

中国团队测评 GPT-6 Astra 具身操控能力,混合架构平均分 62.60

银河通用研究员在 RoboDojo 基准测试 GPT-6 Astraπ₀.₅+Astra 混合架构 10 项任务平均 62.60 分,Direct 模式仅 37.81 分;RoboLab 中 Astra 直接控制成功率 98%。

📄 拒绝机制只读取模型知识的一小片

研究跨四个开放权重模型、三个家族发现,道德理解在预训练中形成低秩子空间,而拒绝门是后训练新建的狭窄控制通道;在OLMo-3四分之三的拒绝因果输入位于道德子空间之外,只需秩一编辑即可移除拒绝。

英伟达开源 IMO 金牌方案,1.5TB 显存门槛引争议

英伟达开源其 IMO 金牌 AI 推理方案,用三套 checkpoint 完成多轮证明搜索,但推理需 1.5TB 显存,被指名为代码平权、实为算力集权。

📄 Carryover Drafting:回收被拒状态加速 LLM 推理

Carryover Drafting把投机解码中验证阶段被拒 token 的隐藏状态回收为临时 KV 上下文,两个目标模型上平均接受长度提升6.5-14.7%,vLLM 端到端加速7.9-14.4%,翻译任务最高加速28.8%

🟩 ⭐ GLM 5.3 API 实测:强制思考,每个正确答案成本比 5.2 低 2.5 倍

GLM 5.3与 5.2 同价(输入$1.40/百万 token,输出$4.40),但不再支持关闭思考,默认 effort 为max。在 11 项任务各跑 3 次的测试中,max 档 33 题全对,每正确答案成本**$0.00468**,比 GLM 5.2 低2.5 倍GLM 5.3 Flash以十分之一价格答对 31/33。

🔶 ⭐ Claude 独立 44 分钟破解 370 年前密文,连带解锁第二段密码

研究员给Claude Fable 5.1 抛出开放式命题——破解 17 世纪学者Sir Thomas Urquhart留下的“双行密码”。它耗时44 分钟、消耗17.6 万 Token、人类零干预下完成破解,并顺带解开同一作者沉睡 370 多年、含 285 个数字的“八行密码”。

📄 法律奖励模型基准 LegalRewardBench 发布

LegalRewardBench将法律 QA 转为上下文偏好数据,长度平衡增强使 grounded 法律评估比基线最高提升**+25.6 个百分点**;在维多利亚刑法数据上微调后,对美国住房法规 QA 提升**+16.2 个百分点**,显示跨法域迁移。

𝕏 Claude 集成 Salesforce,内置 37 项预置销售技能

AnthropicClaude 上线 Salesforce 集成 Beta 版,可直接调用账户、商机和销售管道数据,并内置 37 个预置销售技能,无需离开对话即可准备会议、复盘交易、生成管道看板与发送预测。

Claude Opus 5.2 在 Claude Code 灰度测试

开发者发现Claude Code调用 Opus 5 时后端已路由至Opus 5.2,跳过 5.1 版本,生成速度、代码完成度和长任务自主迭代能力明显提升;此前内部报告称未发布模型已接管 Anthropic 大部分代码编写。

📄 TriCalRAG:本地 LLM 根因分析基准显示 RAG 显著稳定校准

TriCalRAG在 BGL、HDFS、Thunderbird、OpenStack 四个日志数据集上评测本地 LLM,RAG比零样本提示平均 F1 提高0.10-0.27,并避免模型将最高 100%事件判为异常;批处理吞吐量提升41 倍,4-bit 量化降延迟 20%。

📄 NLKGQ:用受控语义让 LLM 直接生成 SPARQL

NLKGQ把完整 OWL 本体放入 LLM 上下文,零样本生成 SPARQL 查询;在DBLP-QuAD 3.1上达89.9% MatchSemOpenAlex上达98% Match,超过公开基线 86%。

💻 OpenAI 证实与 Anthropic、Google DeepMind 进行数周 AI 安全磋商

OpenAI确认与AnthropicGoogle DeepMind进行了数周AI 安全谈判,而特朗普团队淡化安全担忧、推动保持对华领先。磋商发生在业界围绕监管与研发节奏争论升温之际。

📄 GraMRAG:图记忆引导多智能体多步推理

GraMRAG用动态多模态记忆图建模动作-观察依赖,并提出拓扑感知策略优化 TAPO进行关键路径识别与节点剪枝;在挑战性多模态基准上取得最先进性能,缓解状态盲区和冗余检索。

📄 RAG 压缩会严重损害引用归因

ASQAQASPER上,RECOMP式压缩器引用摘要精确率为0.86,但对源片段仅0.12;抽取式选择 grounded precision 为 0.43-0.49,RECOMP 设置下源恢复后声明不支持率达 0.88。

📄 Salesforce 发布企业级模型 Koa,专攻 Agent 工具调用

Salesforce 发布企业级语言模型 Koa基于开源 Nemotron-3-Super-120BGRPO 强化学习后训练,专为销售、营销和客户支持任务打造,在 CRM 与多轮工具调用基准上超越强闭源基线。

Anthropic 滥用报告披露中国实验室系统性蒸馏 Claude

Anthropic发布滥用报告,覆盖 2025 年 12 月至 2026 年 8 月破坏的七类危害活动,DeepSeek、Moonshot、小米等通过大量真实查询尝试蒸馏 Claude;报告将蒸馏视为最重要威胁,因其传递能力却不传递防护。

𝕏 ChatGPT 将于 10 月 14 日下线 GPT-5.5

OpenAI 宣布 10 月 14 日在 ChatGPT、ChatGPT Work 及 Codex 中下线 GPT-5.5,Codex 用户需迁移至 GPT-5.6 SolGPT-6 Astra

智象发布首款物理规律导向视频生成模型 HiDream-O1-Video-1.0

智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型HiDream-O1-Video-1.0,以物理规律为导向,称全球 AI 视频榜单第一梯队再添中国力量。

𝕏 OpenAI 与 Product Hunt 推出 GPT-6 Astra 挑战赛

OpenAIProduct Hunt举办GPT-6 Astra挑战赛,9 月 18 日发布,前五名各获1 万美元 API 额度和 1 年 ChatGPT Pro。

📄 CompCQR:无需训练的组合式对话查询改写

CompCQR通过组合少量原子组件生成大量查询,减少 LLM 调用;在四个对话检索基准上,MRR 相对提升最高 22.5%,且适用于开源/闭源 LLM 与稠密/稀疏检索器。

𝕏 Odyssey 发布 Odyssey-3,单模型驱动汽车机器人与无人机

Odyssey 发布 Odyssey-3,单一模型可驾驶汽车、控制机器人、操纵无人机、驱动人形机器人并玩电子游戏,该公司三月前刚融资 3.1 亿美元

𝕏 Image-to-WebDev Arena 更新:GPT-6 Astra、Claude Fable 5.1 等四款新模型上榜

GPT-6 Astra (Max)1733分登顶 Image-to-WebDev 榜,高于 GPT-5.6 Sol 129 分;Claude Fable 5.1 (Max)1710分列第二;Muse Spark 1.3 (Max) 1645 分、GLM-5.3-Flash 1588 分进入帕累托前沿。

📄 多智能体 LLM:分化方式比拓扑影响更大

Qwen2.5-14BLlama-3.1-8B上控制拓扑与多样性来源,并行学习专业化在 Qwen 达52.83 Macro-F1,Llama 达 52.94;拓扑影响小于智能体分化方式,Qwen 上学习宽度优势为 2.83 分,Llama 仅 0.17 分。

📄 PLUME:面向持续更新的免训练上下文参数化

PLUME为 LLM 构建全局更新表示,激活记忆证据形成局部参数视图,并在解码时自适应融合;MUSE-bench上平均ROUGE-L Recall 相对提升 29.9%,LLM-as-a-Judge 提升54.9%

📄 NeuroActiSep:单次前向检测 LLM 事实幻觉

NeuroActiSep最终提示 token 处排序前馈神经元,并将选中的神经元身份迁移训练幻觉分类器;实验显示基于这些神经元特征的探针性能与内部状态探针相当,并分析层深对检测的影响。

📄 激活空间可分性可预测 LLM 可操控性

研究发现简单的分离度指标与语言模型下游可操控性强相关,即使控制层数和数据集效应后仍成立;合成叠加实验表明分离度与经验特征和真实特征方向的对齐强相关,可作为转向向量是否有效的诊断。

OpenRouter 用户上周对 OpenAI 模型支出首次超过 Anthropic

OpenRouter数据显示,上周用户对OpenAI模型的支出超过Anthropic,为两年半多来首次。

𝕏 英伟达、Palantir 因数据留存策略限制使用 Claude Fable

据 The Information,英伟达Palantir、Booz Allen Anthropic30 天日志留存政策限制使用 Claude Fable,Palantir 在获得不可撤销的零数据留存保证前拒绝开放接入,显示合同条款可压倒模型基准领先。

𝕏 PhysBrain 1.5 开源,具身 AI 28 项基准登顶

PhysBrain 1.5 发布,80 亿参数开源具身 AI 模型,将场景理解、机器人动作生成与未来帧预测统一为 token,28 项基准上得 72.5 分,超越所有开源模型

Sam Altman 暗示本周及 DevDay 将有重大发布

Sam Altman暗示OpenAI本周有动作DevDay发布规模将达外界此前对 DevDay 2025 的预期。

𝕏 字节 Seedance 2.5 支持单次生成锁定 25 个镜头

Seedance 2.5可依据分镜图在一次生成中锁定25 个镜头,进一步提升 AI 视频的可控性与一致性。

𝕏 微软发布 MAI 模型行为准则:人类控制不可谈判

微软 AI发布未来MAI 模型的“行为准则”,要求模型在被指示时停止、不自行设定目标、不让自己更难被人类中断或关闭,不得模仿意识、声称感受或鼓励情感依赖,并拒绝追求法律人格或模型权利。声明“人比 AI 更重要”且“AI 不应超越人类控制

📄 首个哈桑尼亚语大模型 Enemray 发布

Enemray面向毛里塔尼亚 哈桑尼亚语 的语言模型,采用稳定性—可塑性训练流程,在英语→哈桑尼亚语翻译上超过对比的开源与闭源模型,同时保留基座的数学、代码与函数调用能力。

𝕏 DeepSeek V4.1 Flash 真实体验:Agent 与代码能力大幅提高

用户反馈DeepSeek V4.1 Flash一天使用成本约20 元Agent 能力代码能力大幅提高,多模态调试闭环完全可用。

📄 OrchSLM:非交互式小语言模型编排框架

OrchSLM 提出非交互式小模型编排框架,统一现有路由方法,揭示任务结构、模型池构成与多智能体共识如何影响编排行为。


EVENT-DRIVEN INTELLIGENCE

免费先跟踪重点,再决定是否升级

每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件建立复访,再决定是否升级到更深的追踪能力。