天眼晚报
🤖 AI 大模型
𝕏 智谱发布 GLM-5.3:743B 模型强化编程与网络安全,权重两周后开源
智谱 AI发布GLM-5.3,基于743B参数后训练强化学习,编程与长程 Agent 能力大幅增强,成为开源最强。在 269 个真实项目中找到2436 个漏洞(含 1097 个中高危),安全防御能力显著提升。权重两周后开源,Ollama 承诺支持。后训练技术栈含 IndexShare、SAO、slime 框架。
DeepSeek API 8 月 17 日起大幅涨价,高峰时段最高涨 12 倍
DeepSeek邮件通知,8 月 17 日起调整 API 价格,引入高峰/非高峰峰谷定价,闲时价格上涨超 2 倍,高峰最高上涨12 倍;以 V4 Pro 为例,命中缓存的高峰价格较原价上涨 1100%,输出涨幅 350%。
𝕏 ChatGPT 上线 Computer History 操作历史功能,可记忆跨应用行为
ChatGPT推出Computer History(操作历史)功能,自动记录桌面端与跨应用/网站访问行为并转化为记忆,支持接续工作、查找近期内容、复用工作流;目前仅Pro 订阅和企业用户可用。
𝕏 百度 Kuku AI 更名后月活超 2500 万,推出桌面和企业版
百度旗下Kuku AI(原 GenFlow)月活用户超2500 万,推出桌面端、网页端和企业版,将通用 AI 引入专业工作流。
谷歌发布 Gemini 3.7 Flash:API 价格减半,编码与 Agent 能力大幅提升
Google发布Gemini 3.7 Flash正式版,API 入门定价降至**$0.75/$3.75**每百万 token(限时半价至年底),编码能力大幅提升:DeepSWE 从 48.6%升至 65.3%,性能达到 Sonnet 5 级别,成本不到一半;GA 版本修复预览版并发与稳定性问题。
𝕏 DeepSeek Harness 全面开源:一切皆插件,20 小时涨至 8 万星
DeepSeek以MIT 协议开源 Agent 运行时Harness,将模型、工具、沙箱、循环、UI 全部插件化,支持近 40 家模型接入,提供四种模式;发布 20 小时 GitHub 星标涨至8 万+,65 天产出 84 万行代码,插件标签 1425 个、精选仓库 211 个,并发表 88 页论文。
𝕏 GPT-5.6 破解数学难题:协和博士生解决 Crouzeix 猜想
协和博士生金山木用GPT-5.6解决了 2004 年提出的Crouzeix 猜想,该问题是矩阵分析领域核心未解难题,结果已获 Crouzeix 本人和多位数学家确认。
𝕏 MAGI-2 开源:114B MoE 视频生成模型,成本降低 90%
MAGI-2开源视频生成模型,总参数114B、仅激活 6B,生成成本为主流模型的 1/10,大幅降低视频生成门槛。
𝕏 OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 提速 14 倍
OpenAI预览Ultrafast 模式,将GPT-5.6 Sol速度提升14 倍,先通过 API 向选定客户开放,后续扩大范围。
𝕏 MiniMax 开源 Music 3.0:8GB 显存生成 5 分钟完整歌曲
MiniMax开源Music 3.0,一次生成5 分钟完整歌曲,支持 32kHz 立体声,单卡 8GB 显存可运行,附 1000 个模板,并可提示词编排歌曲结构、人声与节奏。
𝕏 Grok 4.6 多项基准公布:登顶 CursorBench,ARC-AGI 成绩亮眼
Grok 4.6在CursorBench真实编码评测中排名第一;在ARC-AGI测试中,ARC-AGI-1 得分87.5%,ARC-AGI-2 得分 67.1%,成本显著低于 GPT-5.6 Sol。
𝕏 苹果与阿里合作训练中国专属 LLM
苹果与阿里巴巴合作训练中国专属大语言模型,不再依赖第三方;Apple Intelligence 预计数月内随 iOS 更新进入中国市场。
𝕏 Google 发布首个通用手语转文本模型 SL2T
Google发布首个通用手语转文本模型(SL2T),支持美式手语(ASL),已在 Android 上线输入功能。
𝕏 dots3-note 开源:280B MoE 多模态模型支持 512K 上下文
dotsstudio发布开源模型dots3-note,280B MoE 架构(激活 16B),支持512K上下文与图像、音频、视频理解,采用 Apache 2.0 协议。
𝕏 马斯克:Grok 4.6 需配合 Grok Build harness 使用
马斯克表示,Grok 4.6在Grok Build harness下表现最佳,无 harness 体验明显下降,建议开发者使用 Build 环境评测。
𝕏 阿里 Qwen 发布 Qwen3.8-2.4T-A95B:1M 上下文开源模型
阿里 Qwen发布Qwen3.8-2.4T-A95B,总参数 2.4T、激活 95B,支持100 万 token上下文,主打编码与 Agent 能力,已在 Together AI 上线。
𝕏 DeepSeek-V4-Pro-0813 疑发错模型:架构与 Flash 一致,HF 仓库紧急重传
社区发现DeepSeek-V4-Pro-0813开源版架构参数与Flash完全一致,Hugging Face仓库被下架后重传,部分权重文件 hash 也发生变化。
𝕏 Ramp 数据:Anthropic 企业采用率反超 OpenAI,Fable 5 支出占比仅 11%
Ramp7 月数据显示,Anthropic已覆盖 43.5%美国合格企业,反超 OpenAI 的 39.7%;但最贵模型 Fable 5 仅占 Claude 支出的11.4%,价格约为 GPT-5.6 Sol 两倍。
🔶 高性价比中国大模型冲击,美国头部 AI 实验室采购支出降 25%
Silicon Data数据显示,7 月中旬以来客户采购美国头部 AI 实验室模型的实际支出下降近四分之一,OpenAI等被迫大幅下调中端模型价格应对竞争。
DeepSeek-V4-Pro 实测翻车:Agent 能力不如 Flash,官方 Harness 也救不了
开发者三轮实测显示,DeepSeek-V4-Pro在智能体流程上不如Flash,多次出现未做语法校验、JS 错误等基础问题,与官方宣称的“Agent 能力大幅提升”不符。
𝕏 Notion 发布 Knowledge Board:用真实工作流量评测 AI 模型
Notion推出Knowledge Board,基于随机匿名真实流量跨模型评测任务成功率、耗时与成本,并与Anthropic、OpenAI 研究人员合作构建评分机制。
𝕏 Kimi K3 领先 DeepSeek-V4-Pro 67 分,但成本贵近 14 倍
Kimi K3在 Arena 上领先DeepSeek-V4-Pro达67 分,但 DeepSeek 输入/输出价格仅为 Kimi 的 1/6.9 和 1/17.2,同一任务综合成本便宜约 13.8 倍。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。