08月14日 · 科技晚报

天眼晚报

科技|2026年08月14日|72 分钟阅读
来源:895 条推文 + 261 篇 RSS 文章·Lanyun·DeepSeek 生成·2026-08-14
分享
AI 速读18 条精选

🤖 AI 大模型

𝕏 智谱发布 GLM-5.3:743B 模型强化编程与网络安全,权重两周后开源

智谱 AI发布GLM-5.3,基于743B参数后训练强化学习,编程与长程 Agent 能力大幅增强,成为开源最强。在 269 个真实项目中找到2436 个漏洞(含 1097 个中高危),安全防御能力显著提升。权重两周后开源,Ollama 承诺支持。后训练技术栈含 IndexShare、SAO、slime 框架。

DeepSeek API 8 月 17 日起大幅涨价,高峰时段最高涨 12 倍

DeepSeek邮件通知,8 月 17 日起调整 API 价格,引入高峰/非高峰峰谷定价,闲时价格上涨超 2 倍,高峰最高上涨12 倍;以 V4 Pro 为例,命中缓存的高峰价格较原价上涨 1100%,输出涨幅 350%。

𝕏 ChatGPT 上线 Computer History 操作历史功能,可记忆跨应用行为

ChatGPT推出Computer History(操作历史)功能,自动记录桌面端与跨应用/网站访问行为并转化为记忆,支持接续工作、查找近期内容、复用工作流;目前仅Pro 订阅和企业用户可用。

𝕏 百度 Kuku AI 更名后月活超 2500 万,推出桌面和企业版

百度旗下Kuku AI(原 GenFlow)月活用户超2500 万,推出桌面端、网页端和企业版,将通用 AI 引入专业工作流。

谷歌发布 Gemini 3.7 Flash:API 价格减半,编码与 Agent 能力大幅提升

Google发布Gemini 3.7 Flash正式版,API 入门定价降至**$0.75/$3.75**每百万 token(限时半价至年底),编码能力大幅提升:DeepSWE 从 48.6%升至 65.3%,性能达到 Sonnet 5 级别,成本不到一半;GA 版本修复预览版并发与稳定性问题。

𝕏 DeepSeek Harness 全面开源:一切皆插件,20 小时涨至 8 万星

DeepSeekMIT 协议开源 Agent 运行时Harness,将模型、工具、沙箱、循环、UI 全部插件化,支持近 40 家模型接入,提供四种模式;发布 20 小时 GitHub 星标涨至8 万+,65 天产出 84 万行代码,插件标签 1425 个、精选仓库 211 个,并发表 88 页论文。

𝕏 GPT-5.6 破解数学难题:协和博士生解决 Crouzeix 猜想

协和博士生金山木GPT-5.6解决了 2004 年提出的Crouzeix 猜想,该问题是矩阵分析领域核心未解难题,结果已获 Crouzeix 本人和多位数学家确认。

𝕏 MAGI-2 开源:114B MoE 视频生成模型,成本降低 90%

MAGI-2开源视频生成模型,总参数114B、仅激活 6B,生成成本为主流模型的 1/10,大幅降低视频生成门槛。

𝕏 OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 提速 14 倍

OpenAI预览Ultrafast 模式,将GPT-5.6 Sol速度提升14 倍,先通过 API 向选定客户开放,后续扩大范围。

𝕏 MiniMax 开源 Music 3.0:8GB 显存生成 5 分钟完整歌曲

MiniMax开源Music 3.0,一次生成5 分钟完整歌曲,支持 32kHz 立体声,单卡 8GB 显存可运行,附 1000 个模板,并可提示词编排歌曲结构、人声与节奏。

𝕏 Grok 4.6 多项基准公布:登顶 CursorBench,ARC-AGI 成绩亮眼

Grok 4.6CursorBench真实编码评测中排名第一;在ARC-AGI测试中,ARC-AGI-1 得分87.5%,ARC-AGI-2 得分 67.1%,成本显著低于 GPT-5.6 Sol。

𝕏 苹果与阿里合作训练中国专属 LLM

苹果阿里巴巴合作训练中国专属大语言模型,不再依赖第三方;Apple Intelligence 预计数月内随 iOS 更新进入中国市场。

𝕏 Google 发布首个通用手语转文本模型 SL2T

Google发布首个通用手语转文本模型(SL2T),支持美式手语(ASL),已在 Android 上线输入功能。

𝕏 dots3-note 开源:280B MoE 多模态模型支持 512K 上下文

dotsstudio发布开源模型dots3-note,280B MoE 架构(激活 16B),支持512K上下文与图像、音频、视频理解,采用 Apache 2.0 协议。

𝕏 马斯克:Grok 4.6 需配合 Grok Build harness 使用

马斯克表示,Grok 4.6Grok Build harness下表现最佳,无 harness 体验明显下降,建议开发者使用 Build 环境评测。

𝕏 阿里 Qwen 发布 Qwen3.8-2.4T-A95B:1M 上下文开源模型

阿里 Qwen发布Qwen3.8-2.4T-A95B,总参数 2.4T、激活 95B,支持100 万 token上下文,主打编码与 Agent 能力,已在 Together AI 上线。

𝕏 DeepSeek-V4-Pro-0813 疑发错模型:架构与 Flash 一致,HF 仓库紧急重传

社区发现DeepSeek-V4-Pro-0813开源版架构参数与Flash完全一致Hugging Face仓库被下架后重传,部分权重文件 hash 也发生变化。

𝕏 Ramp 数据:Anthropic 企业采用率反超 OpenAI,Fable 5 支出占比仅 11%

Ramp7 月数据显示,Anthropic已覆盖 43.5%美国合格企业,反超 OpenAI 的 39.7%;但最贵模型 Fable 5 仅占 Claude 支出的11.4%,价格约为 GPT-5.6 Sol 两倍。

🔶 高性价比中国大模型冲击,美国头部 AI 实验室采购支出降 25%

Silicon Data数据显示,7 月中旬以来客户采购美国头部 AI 实验室模型的实际支出下降近四分之一OpenAI等被迫大幅下调中端模型价格应对竞争。

DeepSeek-V4-Pro 实测翻车:Agent 能力不如 Flash,官方 Harness 也救不了

开发者三轮实测显示,DeepSeek-V4-Pro在智能体流程上不如Flash,多次出现未做语法校验、JS 错误等基础问题,与官方宣称的“Agent 能力大幅提升”不符。

𝕏 Notion 发布 Knowledge Board:用真实工作流量评测 AI 模型

Notion推出Knowledge Board,基于随机匿名真实流量跨模型评测任务成功率、耗时与成本,并与Anthropic、OpenAI 研究人员合作构建评分机制。

𝕏 Kimi K3 领先 DeepSeek-V4-Pro 67 分,但成本贵近 14 倍

Kimi K3在 Arena 上领先DeepSeek-V4-Pro67 分,但 DeepSeek 输入/输出价格仅为 Kimi 的 1/6.9 和 1/17.2,同一任务综合成本便宜约 13.8 倍。


EVENT-DRIVEN INTELLIGENCE

免费先跟踪重点,再决定是否升级

每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件建立复访,再决定是否升级到更深的追踪能力。