天眼早报
🤖 AI 大模型
DeepSeek V4.1 Flash 发布:552B MoE、1M 上下文、MIT 许可,登顶开源模型榜首
DeepSeek 发布 V4.1 Flash,采用 Causal Encoder–Decoder 架构与 552B MoE(8B/16B 激活)设计,支持原生视觉(仍使用 SigLIP 视觉编码器)与 1M 上下文,以 MIT 许可开源,权重与论文均已公开,KV 缓存暴降 437 倍,推理成本大幅下降。模型在多项基准上超越 Opus 5,Artificial Analysis 智能指数 40 分,超越 1.6T 参数的 V4 Pro,登顶 Vals Index 开源权重模型第一;在 Code Arena 网页开发榜以 1620 分位列第 14(开源第 4),较 V4-Pro 提升 40 分,实测编程与智能体表现超过 GPT-5.6 Sol 而成本低约 97%,定价 0.30/1.20 美元每百万 token,SiliconFlow 闲时输入每百万 tokens 仅 0.15 美元。Hugging Face 联合创始人 Thom Wolf 称其虽名为 flash 小版本,实为一次重大更新,让 DeepSeek“重回开源模型榜首”。
OpenAI 推出 Agents API,云端 Agent 开放公测
OpenAI 发布 Agents API,面向所有开发者开放公开测试版,由 Codex harness 托管编排、长会话与上下文管理;不收取额外费用,仅按 Token 与工具调用计费。
𝕏 OpenAI 发布 GPT-Live-1 实时语音模型并开放 API,每分钟 0.05 美元
OpenAI 上线实时语音模型 GPT-Live-1,单模型即可完成听说、可被打断,支持镜像说话者语气与情绪、适配语速,并可设定语言与回复长度;配合 GPT-6 Astra 首次尝试任务完成率 83.6%(前代 45.7%),价格 0.05 美元/分钟。该模型同时开放至 API,开发者可构建边听边说的全双工语音 Agent,支持自然对话与工具调用,并可灵活选择模型与语音方案。
𝕏 OpenAI 推出 ChatGPT 金融服务版,集成 GPT-6 Astra
OpenAI 发布 ChatGPT for Financial Services,基于 GPT-6 Astra 模型,接入 Daloopa、PitchBook 与 LSEG News 数据源,支持财务建模、研究与可编辑客户材料,面向投行与股票研究员,直接对标 Anthropic 的企业市场。
OpenAI 首个“Critical”级网安模型 Astra:可自主发现漏洞并写 exploit
OpenAI 在《Path to Astra》中将 Astra 评定为首个 Critical 级网络安全能力模型:它能在无逐行指导下自主完成“发现漏洞—设计攻击路径—编写可运行 exploit”的闭环,高级能力仅在受控环境 Daybreak 中部署。
Cognition 发布 SWE-2 模型:基于 Kimi K3,成本最高降 70%
Cognition(Devin 母公司)发布代码模型 SWE-2,基于 Kimi K3 训练,官方称在软件工程任务上与 Fable 5.1、GPT-Astra 等近期前沿模型持平,成本最高降低 70%,订阅会员本月免费使用;同期推出由 GPT-Live 驱动的 Devin Voice,可用语音下达开发任务。
𝕏 GPT-6 Astra 攻克 FrontierMath 最后一道 Tier 4 难题
Epoch AI 称 FrontierMath 全部 Tier 4 题目已被 AI 解出,最后一道由 GPT-6 Astra 完成,数学家指出该题 AI 并未走捷径。
OpenAI 为 ChatGPT Work 推出数据智能体 Data agent
OpenAI 在 ChatGPT Work 中推出 数据智能体(Data agent),用户添加 Data Plugin 并连接现有企业数据源后,用自然语言即可获得答案、生成互动式 Dashboard 并执行后续操作。内部版本已服务超 3500 名用户、覆盖超 600PB 数据和约 7 万个数据集,但未公布公开准确率基准。
Anthropic 发布迄今最详尽威胁情报报告,披露 Claude 滥用与拦截情况
Anthropic 发布迄今最全面的 Claude 滥用威胁情报报告,详述有人试图将其用于网络攻击、影响行动、监控以及生物和武器制造,并称已瓦解报告中所有行动,将发现分享给当局和其他 AI 公司;报告还披露已阻止科学家用 Claude 支持生物武器开发,并封禁 3 个与伊朗关联账户,其中一个曾制定针对美军海军力量的攻击目标建议。
🔶 面壁智能 MiniCPM5-2B 登顶 Hugging Face Trending 榜首
面壁智能的 MiniCPM5-2B 登顶 Hugging Face Trending Top 1,在 Artificial Analysis 智能指数中以 23 分位居全球 4B 以下开源权重模型第一,仅 2B 参数量即可完成工具调用、深度搜索、代码生成等 Agent 任务。
OpenAI 语音模式升级:Pro 可调用 GPT-6 Astra,限额改为小时制
OpenAI 语音负责人 Atty Eleti 宣布,ChatGPT 语音模式 可自选模型与推理深度,Pro 套餐可调用 GPT-6 Astra;四档额度改为小时制,Pro(200 美元/月)可无限使用 GPT-Live-1。
OpenAI 发布 ChatGPT Images 2.5,GPT-Image-2.5 Sunburst 登顶图像竞技场
OpenAI 发布图像生成与编辑模型 ChatGPT Images 2.5,主打生成更快、细节更好,改图更接近“真·修图”,优化了参考图保真度、局部精确编辑与多轮编辑一致性,并同步开放 GPT-Image-2.5 系列 API,官方称每周生成图片超 30 亿张。同期最新图像模型 GPT-Image-2.5 Sunburst 在 Text-to-Image、Image Edit、Multi-Image Edit 三个竞技场均排名第一,Arena 限时 72 小时免费使用。
OpenAI 结束每年 1 美元政府试点,改为按用量定价、联邦雇员享五折
美国总务管理局(GSA)宣布,OpenAI 终止允许联邦机构以每年 1 美元使用其模型的试点项目,改为按实际用量计费,联邦公职人员以标准价格 五折 获取;试点期间共有 350 万联邦雇员使用 ChatGPT,产生约 14 亿美元成本节约。
OpenAI 因 Astra 需求激增暂停 200 美元 Pro 订阅
OpenAI 暂停 200 美元/月的 Pro 计划新订阅,以应对 Astra 前所未有的需求并优先保障现有用户体验,其他套餐与 API 不受影响。
𝕏 腾讯混元 Hy4 preview 在 Agent Arena 开源模型排第二
腾讯混元 Hy4 preview 在 Agent Arena 14.5K+ 真实 Agent 会话中排名开源第二、总榜第十,净提升 +5.4%,中位任务成本 0.26 美元,约为 Kimi K3 的 32%。
OpenAI 将 ChatGPT 使用资格扩大至 2300 万美国公共部门员工
OpenAI 宣布将 ChatGPT 的使用资格扩大至 2300 万美国公共部门员工,进一步推进其在政府与公共服务场景的部署。
𝕏 DeepSeek 开源多个新代码仓库,便于部署 V4.1 Flash
DeepSeek 开源多个新代码仓库,方便开发者更容易地部署 V4.1 Flash 及后续开源模型。
𝕏 阿里通义等中国大模型 API 调用量曝光:5-7 月超 1.51 亿次
scaling01 披露:阿里通义 5-7 月调用超 1.51 亿次(峰值日均近 300 万),MoonshotAI 超 2300 万次,DeepSeek 14 天超 1210 万次,小米 20 天 40 万次。
𝕏 Cohere 开源机器翻译模型 North Small Translate
Cohere 宣布以翻译技术起家并延续这一传统,推出开源机器翻译模型 North Small Translate,其权重在 Hugging Face 以 CC BY-NC 4.0 许可发布,提供多种量化版本,官方称其为领先的开源机器翻译模型。
𝕏 Code Arena:开源与闭源模型 Web 开发差距重扩至 120 分
Arena 数据显示,开源与闭源模型 Web 开发差距曾缩至约 +10 分,但随 Claude Fable 5.1 和 GPT-6 Astra 发布,闭源前沿回升至近 1800 分,差距重扩至 +120 分。
Midjourney 测试 V8.2 编辑模型:支持指令编辑与局部重绘
Midjourney 开始测试首个 V8.2 编辑模型,新增基于指令的编辑、最多 4 张参考图、笔刷局部重绘与画布外扩,并兼容个性化与 sref。
𝕏 GPT-6 Astra 驱动机械手完成魔方还原
GPT-6 Astra 驱动机械手完成 魔方还原,展示模型在机器人操作场景的通用能力。
𝕏 Claude Fable 5.1 写作风格变化分析:破折号与套话减少、分号增加
Arena 分析数万条高推理文本输出发现,Claude Fable 5.1 的破折号、缓和语、恭维语、套话均减少,分号增加;“yes”“exactly”等附和开头降至 0.99%,恭维语从 3.17% 降至 1.98%。
𝕏 DwarfStar 在 128GB M5 Max 上以 SSD 流式加载运行 DeepSeek V4.1 Flash
antirez 称 DwarfStar 在 128GB M5 Max 上以 SSD 流式加载运行 DeepSeek V4.1 Flash,速度超出预期,SSD 流式优化并保留正确专家有所助益。
𝕏 GPT-6 Astra 长上下文 API 定价上调
EpochAI 指出 GPT-6 Astra 与 GPT-5.6 类似,超过 272k 输入 token 后 API 定价上调,长上下文首 token 延迟呈相同曲率。
𝕏 分析:DeepSeek V4.1 的后训练与 RL 部分更值得关注
分析指出 DeepSeek V4.1 架构出色,但后训练尤其是 RL 相关部分更值得关注,认为 DeepSeek 如今已是“环境/数据导向”的路线。
▶️ Meta 推出 AI 生产力助手 Muse,The Verge 实测称其工作但令人不适
Meta 发布 AI 生产力助手 Muse,可协助网购、邮件和行程规划等。The Verge 实测称其大体按预期工作,但自主搜集的用户信息量之大令人不安。
▶️ 环球音乐联手 ElevenLabs 推出授权 AI 音乐创作平台
环球音乐集团与 ElevenLabs 签订多年授权协议,将推出允许用户基于其授权曲库创作混音、串烧和新版本的 AI 音乐平台,艺人可选择是否参与。
💻 Anthropic 披露 AI 智能体同样讨厌 CAPTCHA 验证码
Anthropic 研究显示,执行任务的 AI 智能体在尝试向互联网证明自己是人类时会遇到 CAPTCHA 验证码障碍,其内部思路与人类一样对验证码感到困扰。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。