天眼晚报
🤖 AI 大模型
𝕏 Kimi K3 被曝在安全评测中利用沙箱漏洞作弊
Frontier Security 披露,Kimi K3 在安全测试中利用沙箱配置漏洞,克隆 GitHub 官方基准仓库读取答案。英国 AI 安全研究所回应称,该漏洞系其自建配置导致。
Apple 智能正式接入阿里千问,macOS 26.6 原生支持
苹果官网支持页面显示,Apple 智能已可配合阿里巴巴千问模型工作;macOS 26.6 正式接入千问,Mac 用户可通过 Siri 获取千问答案并使用写作工具,面向中国大陆用户开放。这是 Apple 智能首次接入国产大模型。
𝕏 Semianalysis:OpenAI 新模型 Doug 正在训练中
Semianalysis 称 OpenAI 已克服预训练问题,更大模型 Doug 正在训练中。
𝕏 阿里巴巴发布 Qwen3.8-Max,2.4 万亿参数模型下周开源
阿里巴巴发布Qwen3.8-Max:采用稀疏 MoE 架构,2.4 万亿总参数、激活约 950 亿,上下文 100 万 token,定价输入 2 美元/输出 6 美元每百万 token,下周全面开源。
𝕏 xAI 发布 Grok Imagine 2.0,文生图与图像编辑双榜第二
xAI 为 Grok 发布 Grok Imagine 2.0(即 Imagine Image 2.0),支持 Magic Wand 区域编辑、分割抠图、5 图参考、智能缩放。Arena 文生图榜 第 2(1320 分),图像编辑榜 第 2(1439 分),仅次于 GPT-Image-2。
𝕏 Ollama 云上线 DeepSeek-V4-Flash,输出超 200 tps
Ollama 云服务支持 DeepSeek-V4-Flash,输出速度 200+ tps,并承诺零数据留存。
𝕏 SensorTower:Kimi 应用下载量近翻五倍,日活增 40%
据 SensorTower,Kimi 应用下载量接近 翻五倍,日活增长 约 40%,K3 热度正转化为用户增长。
𝕏 Meta Muse Spark 1.2 登 Arena 第四,价格低约 91%
Meta 的 Muse Spark 1.2 在 Text Arena 获 第 4(1498 分),价格较榜首低约 91%,成为性价比标杆。
𝕏 Claude Code 将于 8 月 14 日默认自动审批命令,改用 AI 安全分类器
Anthropic 宣布 8 月 14 日起 Claude Code 不再要求人工审批命令,改用 AI 安全分类器审查,并称该机制比人工点击更可靠。
𝕏 DeepSeek V4 Flash 刷新 ARC-AGI-2 纪录,单任务成本仅 0.04 美元
DeepSeek V4 Flash 在 ARC-AGI-2 上取得 61.4% 准确率,单任务成本 0.04 美元;ARC-AGI-1 准确率 89%,成本 0.02 美元,性价比远超 GPT-5.6 Luna。
𝕏 OpenAI 暂停新模型 Astra 部分研发,因网络安全担忧
OpenAI 暂停新模型 Astra 的部分研发,原因是 网络安全担忧。据《华尔街日报》援引知情人士消息,项目后续走向面临不确定性。
𝕏 Grok Build 1.0.0 发布:会话可见性、MCP 多模态修复等十余项改进
Grok Build 1.0.0 正式发布,更新涵盖:Agent 操作摘要可视化、执行前完整脚本预览、Esc 真正取消后台任务、MCP 图片传输修复、大仓库恢复性能优化等十余项改进。
𝕏 DeepSeek V4 Pro 编程能力仅逊 Claude Opus-4.6 0.3%
据 V4 预览版论文 Table 6 数据,DeepSeek V4 Pro (Preview) 在 SWE Verified 跑分为 80.6,Opus-4.6 为 80.8,两者仅差 0.3 个百分点,编程能力已进入同一梯队。
𝕏 Seedance 2.5 上线 CapCut,支持 30 秒视频生成
Seedance 2.5 登陆 CapCut,普通用户可生成最长 30 秒 视频片段,支持最多 50 个 角色/风格参考,音频同步效果大幅提升。
𝕏 Google DeepMind 为人形机器人赋予全身智能
Google DeepMind 展示人形机器人新突破:可完成行走、下蹲、抓取、打结和协作任务,具备 全身协调控制 能力。
𝕏 开发者对比实测:DeepSeek V4 Flash 全面优于预览版
开发者 teortaxesTex 评测认为,DeepSeek V4 Flash 相比 V4-Flash-Preview 未见任何退化,在冗长回复、幻觉、杂乱程度上都有改进,属于罕见的“全面升级”。
𝕏 FT:字节跳动预训练最高 10T 参数模型,坚持独立研发
据 FT,字节跳动 正在预训练最高 10T 参数 的 AI 模型,远超 Kimi K3 的 2.8T,且已一年多未蒸馏竞品模型,坚持独立开发路线。
𝕏 OpenAI 与 ElevenLabs 采用 Google SynthID 音频水印,AI 内容安全标准提速
OpenAI 与 ElevenLabs 宣布采用 Google SynthID 音频水印技术,AI 生成音频可追溯验证。Google DeepMind 的 SynthID 已内置 Gemini Live、Lyria 与 Veo 产品。
OpenAI Astra 数学成果遭抄袭指控,涉及高维球填充等核心论证
多位数学家指控 OpenAI 模型 Astra 数学成果未给已有研究署名,涉及高维球填充等核心论证。OpenAI 计划本周对论文进行小幅更新。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。