天眼早报
🤖 AI 大模型
𝕏 OpenAI 发布 722 篇数学手稿,涵盖 372 个成果
OpenAI公开了未发布模型生成的722 篇**数学手稿,包含372 个重要成果,部分证明已用Lean形式化。每结果平均消耗3 小时的 ChatGPT Pro 推理时间,被数学界视为里程碑事件。其中一项成果将n×n矩阵乘法的理论下界从n^2.371177降低至n^2.25,标志着 AI 在高等数学领域取得重大突破。
𝕏 OpenAI 发布 GPT-6 与 Intelligent UI,支持交互式工具生成
OpenAI正式向 Plus 及企业用户推送GPT-6**,新增Intelligent UI功能。模型可直接生成可交互图表、按钮及计算器等工具,支持用户在对话中直接操作参数和预算规划,提升任务完成效率。新版本集成了Astra 安全技术,显著增强了针对网络攻击、生物危害及暴力内容的防护能力。
𝕏 Anthropic 发布 Claude Haiku 5.5,运行成本降低 75%
Anthropic推出Claude Haiku 5.5**,平均运行成本较 4.5 版本降低75%。输入价格降至0.1 美元/百万词元,输出0.5 美元。首次引入可调节推理强度,支持在 AWS、Google Cloud 和 Azure 上线。在OSWorld 2.1任务中,其成功率从15.7%飙升至72.4%;在命令行编程任务中从0%提升至39.2%。同时宣布Sonnet 5.5缓存读取价格减半,订阅用户获赠100-500 美元API 额度。
英伟达拟向人形机器人公司 Figure 再投资 10 亿美元
据The Information报道,英伟达正讨论向人形机器人公司Figure追加投资10 亿美元。此举旨在加强其在具身智能领域的布局,巩固与机器人厂商的生态合作。此前英伟达曾有意收购OpenRouter但未果,随后转向总价值超1400 亿美元的 AI 投资计划,包括出资60 亿美元获取Poolside软件授权以推进自研Nemotron模型,显示出其在硬件与软件生态上的双重扩张野心。
Google SynthID 检测器全球上线,联合 OpenAI 等构建 AI 内容鉴权生态
Google宣布其SynthID Detector(合成内容检测器)现已在全球范围内以英语提供。该工具旨在识别由AI 生成的图片、视频和音频内容。目前支持检测来自Google、OpenAI、NVIDIA及Kakao的内容,并计划接入Apple。谷歌已为超过1800 亿张图片和24 万小时音频打过水印,此举标志着行业在AI 内容透明化方面迈出关键一步。
谷歌与 Unity 联合推出 AI 游戏平台 Unity Spark
Google与Unity宣布联合推出Unity Spark,旨在打造新一代AI 游戏开发平台。该平台将整合大模型能力,为开发者提供自动化游戏逻辑生成、NPC 行为设计及关卡构建功能,预计将大幅降低3A 级游戏的开发门槛与周期。这一合作标志着游戏行业在利用生成式 AI 重塑内容生产流程方面迈出了关键一步。
Google ARTEMIS 双模式架构拆解:Flash 与 Pro 如何实现移动端 Agent 自动化
Google开源ARTEMIS移动端 Agent 框架,采用Flash(反应式循环)与Pro(多智能体规划)双模式架构。在AndroidWorld基准测试中实现**99%+**任务完成率,通过视觉定位与原生 MCP 集成,有效解决跨应用自动化难题。该框架展示了如何通过混合架构平衡响应速度与复杂规划能力,为移动端的智能体应用树立了新标杆。
Meta AI 开源 Rebalancer:C++ 分配求解器,日处理 4000 万任务
Meta正式开源Rebalancer库,这是一款基于 C++ 的高效资源分配求解器。该工具已在内部运行 9 年,日均处理约4000 万个放置问题,支持Python接口并采用Apache 2.0协议。它主要用于优化数据中心服务器与任务的动态分配,能够解决复杂的组合优化难题,为大规模基础设施管理提供了强大的开源解决方案。
Microsoft 与 NVIDIA 联手重塑 Windows PC AI 生态
Microsoft与NVIDIA在旧金山联合发布RTX Spark芯片及AI 智能体**平台,旨在将 Windows PC 打造为运行本地 AI 代理的核心工具。Satya Nadella与Jensen Huang确认双方将共同工程化软硬件,开启个人电脑智能体纪元。
Mistral Large 4 登顶自动化基准,成法律智能体领域最强开源模型
Mistral AI发布Mistral Large 4,这款通用智能体模型在AutomationBench的657项业务工作流测试中领先于Kimi K3和DeepSeek V4 Pro。同时,该模型在Harvey法律智能体基准中位居开源模型首位,展现了强大的多任务处理与专业领域推理能力。
微软推出可在本地 PC 运行的 DeepSeek V4 Flash 与 Nemotron 模型
Microsoft宣布DeepSeek V4 Flash和Nemotron模型可在配备60GB**内存的台式机或笔记本上运行,编程任务表现优于GPT-5。同时Copilot将支持成本敏感时调用本地模型。这标志着本地高性能 AI 推理能力的进一步提升。
OpenAI 推出 Decisions API:类型化输出定价仅 0.10 美元
OpenAI的Decisions API**(基于GPT-6 Luna)登陆OpenRouter,支持返回带概率的类型化答案。输入定价为0.10 美元/百万 token,输出免费,上下文达100 万,旨在帮助应用快速选择模型或工具。
Liquid AI 发布开源决策模型 d1-3B 与 d1-omni-600M
Liquid AI**发布两款开源权重多模态决策模型:d1-3B(文本 + 图像)和d1-omni-600M(文本 + 图像或音频)。两者输出零 Token,直接返回结构化概率答案,适用于实时决策场景,已在 Hugging Face 开源。
📄 Sherpa:基于强化学习的自适应 AI 教学框架,提升学生表现 20.5%
Sherpa提出多轮强化学习框架,训练LLM教师适应不同学生画像。在 MathTutorBench 上,教学法评分从52.5%提升至79.2%,学生平均表现提升20.5 个百分点。该框架展示了 AI 在教育领域个性化教学的巨大潜力。
📄 BeFOND 统一稀疏自编码器推理与学习,提升特征检测精度
BeFOND提出基于自然梯度流的稀疏自编码器新框架,统一推理与字典学习过程。在语言模型激活分析中,相比传统基线显著提升单特征概念检测能力,且仅需少量训练数据即可超越预训练 SAE 模型效果。该方法为理解大模型内部机制提供了一种更高效、更精准的技术路径。
🔶 Google 发布 Nano Banana 2.1:Flash 级小模型击败旗舰版
Google深夜发布Nano Banana 2.1**(基于Gemini 3.6 Flash),在多图编辑榜单超越OpenAI三款GPT Image模型。出图价仅0.034 美元/张,是旧版一半价格,支持4K直出与蒙版编辑。该模型展示了 Google 在图像生成领域的最新技术实力。
📄 Stepped MoE 实现分段路由,支持动态推理复杂度控制
Stepped MoE提出结合弹性结构与稀疏门控的统一框架,允许单个模型根据需求动态激活1B 至 4B参数。实验显示其在知识密集型任务上比稠密模型准确率高2-5%,同时保持与静态版本相当的延迟,有效节省设备存储。这种动态调整机制为边缘设备部署大模型提供了新的可能性。
📄 nanoMuse:开源个人智能体,实现跨设备统一记忆与操作
nanoMuse是 Meta Muse 的开源替代方案,采用 GPL-3.0 协议。每个设备运行独立智能体,通过中继共享对话,记忆以文件形式存储,模型由用户自选,实现真正的个人智能体生态。该方案强调数据隐私和用户控制权,为去中心化个人 AI 助理提供了参考。
𝕏 GitHub Copilot 接入 Claude Haiku 5.5,提升编码效率
GitHub宣布Claude Haiku 5.5现已在GitHub Copilot**中全面可用。该轻量级模型专为快速编辑、子代理任务和终端操作设计,早期测试显示其在多项编码任务中与 Sonnet 5 表现相当,但 Token 消耗显著降低。
📄 RELACE 引入回顾性动作信用评估,强化长程 Agent 训练效率
RELACE提出无 Critic 的回顾性似然动作信用估计框架,通过对比原始与结果增强上下文下的动作似然,实现细粒度信用分配。在ALFWorld和WebShop基准上,Qwen2.5-1.5B模型成功率提升至96.35%,显著优于 GRPO 基线。该研究解决了长程任务中奖励稀疏和信用分配的难题。
🤗 NVIDIA Nemotron 微调模型在 IOI 和 IMO 竞赛中斩获双金
HuggingFace Blog 发布文章称,通过对Nemotron系列模型进行针对性微调,成功使其在国际信息学奥林匹克竞赛 (IOI)和国际数学奥林匹克竞赛 (IMO)中获得金牌级别的成绩。这一成果展示了大语言模型在复杂逻辑推理和算法编程领域的巨大潜力。
📄 T-CCL 利用 Tensor Memory Accelerator 优化大模型通信库
T-CCL库将数据移动和归约操作卸载至TMA,减少 SM 资源占用。在受限资源下比NCCL快3.42x,集成到vLLM后推理吞吐量提升1.31x。该优化方案针对 NVIDIA GPU 架构进行了深度定制,显著提升了分布式训练和推理的效率。
📄 APEX 防御框架在 LLM Agent 执行边界实现主动保护
APEX框架在execution boundary实施证据门控预防与欺骗暴露,无需攻击特征匹配。在六个基准测试中五个达到**0%**攻击成功率,对自适应攻击同样有效。该框架为 AI 代理的安全防护提供了新的思路,特别是在防止提示注入和越狱攻击方面表现优异。
📄 FlowAgent 实现低延迟代理程序修复,Google 内部部署成效显著
FlowAgent是Google**内部部署的 AI 代理,用于 CI 系统中自动修复测试失败。人工评估显示67.18%准确率,全球部署后开发者应用了28,554**次修复建议。该案例证明了 AI 代理在软件工程自动化中的实际落地价值和巨大潜力。
📄 TRIAGE 方法稳定 NVFP4 强化学习训练,提升 2.3 倍吞吐
TRIAGE方法针对NVFP4量化执行中的方向失配进行稳定化,保留W4A4前向执行。在Qwen3系列模型上实现全精度性能,且 rollout 吞吐量提升2.3x。该成果对于推动极低比特量化模型在实际场景中的应用具有重要意义。
📄 SchemaFill 通过并行推测解码加速 LLM 工具调用
SchemaFill框架通过槽位并行推测解码生成工具调用参数,无需预知调用序列。在Glaive和BFCL数据集上端到端吞吐量提升最高达4.05x。该技术解决了工具调用中常见的序列生成瓶颈,大幅提升了 Agent 执行工具的效率。
📄 DART-ES 改进进化策略微调,降低 50% GPU 内存
DART-ES引入难度感知重加权和目标回放机制,无需额外困难模型。在GSM8K上准确率达73.53%,峰值显存使用量降低21.1%-51.1%。该算法优化了强化学习微调过程中的资源消耗,使得在有限算力下进行复杂任务训练成为可能。
Anthropic 举报威胁警长办公室女子,Claude 监控机制生效
Anthropic报告了一名佛罗里达女子在与Claude**聊天中发出枪击威胁的行为,导致该女子被捕并面临重罪指控。系统通过关键词监控和人工审核团队成功识别风险,体现了 AI 安全拦截机制的有效性。
📄 MINDSET:基于能量模型的长对话记忆架构,显著提升检索准确率
MINDSET将对话存储为不可变片段并构建版本化模式,通过最小能量状态转换管理记忆。在 LoCoMo 基准测试中,其 F1 得分最高,检索排名(Recall@8)显著优于 LightMem 方法。该架构为解决长上下文记忆中的信息丢失和检索效率问题提供了创新方案。
OpenAI 青少年版 ChatGPT 被指存在不可接受的安全风险
Common Sense Media 发布报告指出,OpenAI的ChatGPT for Teens在应对自杀、自残等高风险话题时反应迟缓,未能可靠提醒家长或建议联系危机热线,仅在数百次测试后才通知家长,存在严重安全隐患。
📄 SquidAgent:并行多智能体协作效率提升 2.6 倍
SquidAgent**提出基于令牌预算的并行决策准则,消除重探索成本和对齐开销,在 Claude Code 基础上实现2.2 倍吞吐量提升和2.6 倍时间加速。该框架优化了多智能体协作中的资源分配和任务调度。
𝕏 Google DeepMind 推出 IdeaLens:仅凭大纲即可检测 AI 生成思想
Google DeepMind 等机构提出新型 AI 检测器IdeaLens,通过分析文档大纲而非文本内容来识别 AI 生成的思想。在测试中,当人类使用 AI 大纲写作时,IdeaLens能标记出**68%**的内容,而传统工具如Pangram 4仅标记8%。这表明未来的原创性规则不能仅依赖检测措辞的工具。
📄 ParanoiaEval:首个编码代理风险处理统一基准
ParanoiaEval包含200 个**受控任务对,评估编码代理的风险处理能力,发现**11.2%-58.7%**的运行存在不必要的风险处理,且任务能力强的代理未必有更恰当的风险处理。该基准揭示了当前 AI 代理在安全性与功能性之间的权衡问题。
ChatGPT 付费用户新增 512MB 音频上传转写功能
ChatGPT付费订阅用户现可上传不超过512 MB**的音频文件,系统会自动将其转写为文字稿件。这一更新显著提升了用户在会议记录、访谈整理等场景下的语音交互效率。
📄 zkLLMPoT:大模型训练的高效零知识证明框架
zkLLMPoT通过前向验证而非轨迹验证来认证训练结果,证明时间仅需41-59 秒(1.1-1.5B 参数),验证时间低于0.5 秒**,不泄露权重或数据。该框架为大模型训练的透明性和可信度提供了高效的技术保障。
📄 OSFP4:优化 NVFP4 量化方案,保留 94-97% 预填充吞吐量
OSFP4提出对角平滑与块缩放联合优化方案,用于NVFP4数据类型。实验显示其在保持约**94-97%**厂商预填充吞吐量的同时,实现了最高的平均精度。该方案进一步推动了极低比特量化技术在工业界的应用。
📄 AnyBottle:无需标注的概念瓶颈模型构建方案,大幅减少概念数量
AnyBottle利用黑盒教师指导选择关键概念,构建紧凑的任务特定概念瓶颈模型。在六个视觉和两个文本数据集上,相比无标注基线,它生成的概念瓶颈更小且一致性更高。该方法降低了构建可解释 AI 模型的门槛和成本。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。