08月20日 · 科技早报

天眼早报

科技|2026年08月20日|79 分钟阅读
来源:1015 条推文 + 193 篇 RSS 文章·Lanyun·DeepSeek 生成·2026-08-19 — 2026-08-20
分享
AI 速读16 条精选

🤖 AI 大模型

𝕏 智谱 GLM-5.3 纯后训练提升编码能力 50%

智谱唐杰称,GLM-5.3基于743B参数 MoE 底座,纯后训练一个月,编码能力提升50%,每次推理仅激活40B参数。

𝕏 OpenAI 预览 Private Safety Processing:零数据留存与风险检测

OpenAI预览Private Safety Processing,为零数据留存客户自动识别跨交互风险,员工无法读取内容;该功能将于9 月推出。相比之下,Anthropic仍要求 Claude 5 系保留 30 天。

𝕏 Long-Horizon Terminal-Bench 发布:300+步终端任务评测 Agent

新基准LHTB用**300+**步终端任务评测 AgentMiniMax M3Kimi k2.7 Code、GLM 5.2 排名前三。

𝕏 TPU 与 Mooncake 集成:KV Cache 显存池化提升推理性能

TPUMooncake集成,在扩展网络实现 KVCache DRAM P2P 池化,提升推理性能/TCO。

𝕏 Agent Arena 上线帕累托前沿:Kimi K3 性价比实测$0.62/任务

Agent Arena上线帕累托前沿,展示模型在真实 Agent 任务中的表现与中位成本。实测Kimi K3 (Max)每任务$0.62,**Claude Opus 5 (Max)**需$3.37 且不及 High 档得分;Grok 4.5 仅$0.22。领先者包括 Claude Opus 5、Kimi K3、GPT 5.5 和 GLM 5.2。

𝕏 在 ESP32-S3 上运行 2890 万参数 LLM

ESP32-S3上运行2890 万参数 LLM,实现边缘推理。

𝕏 Superwhisper 发布开源模型 S1-mini:0.6B 参数量设备端处理

Superwhisper发布首个开源模型S1-mini0.6B参数设备端运行。

𝕏 Replit 免费模式接入 OpenAI 低成本 Luna 模型

Replit新免费模式接入OpenAI Luna模型,总裁 Michele Catasta 称这是两家合作的首个发布,后续还将推出更多合作。

𝕏 OpenAI Codex 将 Asana 前端测试迁移从 5 年缩短至 2 周

OpenAI Codex 帮助 Asana 在两周内完成从 Enzyme 到 React Testing Library 的迁移,原预计需要五年,展示 AI 编程的效率飞跃。

𝕏 LMSYS 与蚂蚁优化 H20 推理:DeepSeek-V4-Pro 接近 B300 性能

LMSYS与蚂蚁发布 SGLang 推理栈,DeepSeek-V4-ProH20上达到271 tokens/s,逼近 B300;1M token 预填 43.7 秒。

𝕏 Ornith-1.5 开源 LLM 发布:自我改进闭环比肩 Claude Opus 4.8

Ornith 发布 Ornith-1.5 系列(9B/35B/397B MoE),模型自主提出任务、生成脚手架并产出轨迹,构成完整自我改进 RL 闭环。397B 版在 Terminal-Bench 2.1(86.1)、SWE-Bench Verified(86)等评测比肩Claude Opus 4.8,全部模型以MIT 协议开源。

𝕏 Grok 4.6 正式上线 Amazon Bedrock

xAIGrok 4.6正式上线Amazon Bedrock,AWS 企业用户即日起可调用该模型。

𝕏 OpenAI 暂停前沿 RL 训练:Astra 模型达到 Critical 网络安全能力

OpenAI CEO Sam Altman 宣布暂停部分前沿 RL 训练,以确保对齐、安全与监控标准达标。此前,OpenAI 发现即将推出的Astra模型达到'Critical'网络安全能力,因此暂停前沿模型强化学习训练两周。他表示模型进展"极其迅速",安全信心将日益决定 AI 进步速度,并承诺继续广泛提供前沿能力。

𝕏 商汤免费公测:DeepSeek-V4-Flash 和 GLM-5.2 可用

商汤开始免费公测,可调用DeepSeek-V4-FlashGLM-5.2;每 5 小时限500 次,自家模型限 1500 次。

𝕏 Gemini 3.7 Flash 登顶 AA-AnalystAgent 定量分析基准

Gemini 3.7 FlashAA-AnalystAgent 基准登顶:准确率 60.0%(pass@5),单任务耗时 1.32 秒,成本 0.54 美元,覆盖金融、医疗等80 项真实定量分析任务。


EVENT-DRIVEN INTELLIGENCE

免费先跟踪重点,再决定是否升级

每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件建立复访,再决定是否升级到更深的追踪能力。