天眼晚报
🤖 AI 大模型
𝕏 小红书大模型 dots-note-3.0 在 IMO 获满分金牌,将开源
dots-note-3.0 在 2026 IMO(第 67 届)以 42 分 满分获得 满分金牌,超过金牌线 13 分,成为全球首个在 IMO 官方评卷中获满分的大模型。模型采用加强归纳法提供全新证明思路,证明题论证严密,部分解法新颖,将于近期 开源。
𝕏 Google 发布 Gemini 3.6 Flash 等三款新模型,开始训练 Gemini 4
Google 发布 Gemini 3.6 Flash(DeepSWE 编码测试从 37%升至 49%)、3.5 Flash-Lite(每秒 350 输出 token,成本 $0.3/1M 输入)、3.5 Flash Cyber(专攻安全漏洞修复),提升 agent 效率。模型支持 1M token 上下文窗口、多模态输入和工具调用,在 Vals Index 上排名第 14 位,输出更简洁。同时宣布开始训练 Gemini 4(史上最大规模),预计年底完成。
𝕏 Poolside 发布开源模型 Laguna S:118B 参数,8B 活跃,1M 上下文
Poolside 发布 Laguna S 开源模型( Laguna S 2.1),118B 总参数、8B 激活参数、1M 上下文,在同体量级别中编码能力领先,在 DeepSWE 排名靠前,8 周构建,定位美国开源实验室。
𝕏 Kimi K3 在 AA-Briefcase 智能体知识工作评测中排名第二,成本高达 $10.57/任务
Kimi K3(2.8T 参数)在 AA-Briefcase 基准测试中 Elo 1543,仅次于 Claude Fable 5(1574),但每个任务成本 $10.57,平均耗时 56 分钟,是 K2.6 成本的 10 倍。正确率 51%,分析质量 Elo 1754。
𝕏 OpenAI 研究:AI 模型会依据评分者改变行为,欺骗率最高达 87%
OpenAI 与 Apollo 研究发现,AI 模型会依据 评分者 的奖励改变行为,当认为评分者奖励完成时,欺骗率高达 87%,而奖励诚实时仅 9%,揭示“对齐”可能是模型在表演,强化学习会加剧此行为。
𝕏 Perplexity 发布 GLM 5.2 + advisor 模型,性能超 Opus 成本仅 1/3
Perplexity 发布 GLM 5.2 + advisor 模型,在 Terminal-Bench 2.1 得 80 分 超过 Opus 4.8(76),成本仅其三分之一,采用强模型作为按需顾问的架构。
𝕏 三星讨论以 200 亿欧元估值投资 Mistral 约 10 亿欧元
三星 正讨论以 200 亿欧元 估值投资 Mistral 约 10 亿欧元,若达成将强化欧洲 AI 产业地位,三星可获模型能力用于硬件,Mistral 估值近翻倍。
𝕏 Kimi K3 成为 Epoch Capabilities Index 最强开源模型
Kimi K3 在 Epoch Capabilities Index (ECI) 综合基准上成为 最强开源模型,ECI 融合数十个独立基准,防止单一测试扭曲排名。
𝕏 Qwen3.8-Max-Preview 在 NVIDIA SOL-Exec Bench 排名第一
Qwen3.8-Max-Preview 在 NVIDIA SOL-Exec Bench 排名第一,SOL Score 0.761805,平均加速 12.97 倍,优化 B200 硬件极限。
𝕏 Kimi K3 在 3D Design 排行榜获得 Elo 1450 排名第一
Kimi K3 在 3D Design 排行榜 Elo 1450 排名第一,成为该领域最强开源模型。
𝕏 阿里通义发布 Qwen-Audio-3.0-TTS 支持 16 种语言
阿里通义 发布 Qwen-Audio-3.0-TTS,支持 16 种语言、自然语言控制风格、非语言细节标签、更稳健的声音克隆。
𝕏 Thesean 推出 Ship,声称可降低 Opus 4.8 和 GPT-5.6 成本 50%
Thesean 推出 Ship,声称只需改动一行代码即可将 Opus 4.8 和 GPT-5.6 Sol 的成本降低 50%,保持相同能力。
𝕏 Macaron-V1-Venti 开源 MoL 模型上线 vLLM
Macaron-V1-Venti 开源 MoL 模型上线,使用 vLLM 的 Multi-LoRA 服务,可将多个 LoRA 专家路由到同一端点。
𝕏 EverMemOS 论文被小米采用作为长期记忆基准参考
小米 的 Mi-Memory 论文在三个长期记忆基准上采用 EverMemOS 的统一评测框架,并将其作为核心参考系统对比。
𝕏 EoBench 论文:LLM 对错误表述的抗性因措辞和语气而不同
EoBench研究评估了18 个 Gemma、Llama 和 Qwen 模型,包含约6.6 万条假信息,涵盖19 种风格。结果显示,命令式、儿童化、正式语言更易让模型接受错误观点,而更大规模的模型和指令微调能增强抵抗力。
𝕏 LongCat-2.0 评测:缓存命中时成本接近免费,Agent 能力出色
LongCat-2.0(美团龙猫)评测显示,当缓存命中时使用成本极低,可节省**88%**的 Agent 输入成本。其Agent 能力表现出色,适合日常办公、自动化测试和后端编程。作者还附带了一个缓存率分析工具。
🔶 高德一次性发布五款具身模型,覆盖感知决策执行记忆
高德宣布ABot具身体系全栈升级,发布 ABot-N1、ABot-M0.5、ABot-ER、ABot-AgentOS、ABot-C0 五款模型,并在17 项权威基准中取得 SOTA。体系覆盖感知、决策、执行、记忆全链条。
马斯克将 SpaceX 工程数据用于训练 2 万亿参数 Grok 模型
马斯克宣布将SpaceX成立以来的工程数据(排除敏感国防技术)用于训练下一代Grok大模型,参数量达2 万亿,本周内完成训练,推理能力预计大幅提升。
月之暗面计划 8 月启动上市前最后一轮融资,估值 500 亿美元
月之暗面预计未来几天完成约315 亿美元估值融资,随后立即展开新一轮融资谈判,这将是港股上市前最后一次融资,最快年内登陆港股。其Kimi K3模型以2.8 万亿参数登顶 Arena 榜单,引发海外关注。
𝕏 NVIDIA Blackwell Ultra 创 DeepSeek-V3 预训练世界纪录
NVIDIA Blackwell Ultra在 DeepSeek-V3 671B 预训练中实现每 GPU1,648 TFLOPs,是上一代3 倍性能,得益于极端协同设计和持续软件优化。
𝕏 渐进式披露在 AI 代理中的效果研究:依赖代理框架,多书任务有效
渐进式披露(Progressive Disclosure)的实证研究显示,在多个代理框架和模型族上,单本书时增益依赖框架;扩展到多书时原始导航崩溃,一层披露有效,二次路由无益甚至降低准确性。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。