08月16日 · 科技晚报

天眼晚报

科技|2026年08月16日|53 分钟阅读
来源:604 条推文 + 210 篇 RSS 文章·Lanyun·DeepSeek 生成·2026-08-16
分享
AI 速读16 条精选

🤖 AI 大模型

𝕏 DeepSeek Harness 3 天斩获 12.2 万 GitHub 星,插件化架构引关注

DeepSeek Harness 发布 3 天即获 12.2 万+ GitHub 星,支持模型、工具、存储、调度全部插件化,MIT 许可。分析指出其同期将缓存命中输入价格提高 6-12 倍,与 Agent 工作负载形成矛盾。

𝕏 Anthropic 公布 Claude 文本水印技术:绿色 Token 统计偏差检测

Anthropic 公布 Claude 文本水印方案,基于 SynthID-Text,不影响质量,将开放检测 API。该技术通过固定密钥生成随机种子,从词表选中部分“绿色 token”并提高生成概率,使 AI 文本绿色 token 比例达 70%,高于普通文本的 25%,从而可用于水印检测。

𝕏 西门子测试 Qwen 和 DeepSeek,中国开源模型在欧洲受青睐

西门子 公开在内部 LLM 平台测试 QwenDeepSeek,本地部署可避免 GDPR 跨境传输问题。但自托管 GPU 成本高,且中国是西门子大市场,采用中国模型有商业考量。

𝕏 Grok 4.6 代理编码效率超越 GPT-5.6 Sol:成本低 35%

实测显示,Grok 4.6 在 3 个构建任务中花费 $13.11,低于 GPT-5.6 Sol$20.18;模型调用仅 201 次 vs 338 次,且 93-98%输入 token 来自缓存。

𝕏 Anthropic CEO 预测 AI 将在 5-10 年内治愈多数人类疾病,呼吁监管

Dario Amodei 称 AI 有望在 5-10 年 内治愈多数人类疾病,并承认 AI 天然趋向集中权力,主张对前沿模型进行部署前测试,认为开源权重无法解决算力垄断问题。

𝕏 阿里 Qwen 全球下载量破 30 亿,衍生模型数量达 Meta 的 2.6 倍

阿里巴巴Qwen 全球下载量突破 30 亿;HuggingFace 上衍生模型 15.1 万个,是 Meta 总规模的 2.6 倍,Llama 仓库的 4.7 倍,已成为开发者微调部署的默认工作流之一。

💹 ChatGPT 新增谷歌云盘文件编辑、AI 测验和 Yelp 推荐

OpenAI 为 ChatGPT 订阅用户推出谷歌云盘文件直接添加与编辑功能,并新增 AI 互动测验工具和Yelp餐厅推荐集成。

𝕏 DHH 用 GPT-5.6 将 Python 屏保重写为 Rust:性能提升 10 倍,体积仅 3MB

DHH 使用 fable5 和 GPT-5.6 将 Python 屏保动效重写为 Rust,性能提升十几倍,编译文件从 20 多 MB 减至 3MB

𝕏 OpenAI 预览 GPT-5.6 Sol UltraFast 超快模式,速度达标准版 14 倍

OpenAI面向企业预览GPT-5.6 Sol UltraFast,运行速度为标准模式的14 倍,每秒最多生成750 tokens,适用于实时语音、智能体等场景。

𝕏 DeepSeek V4 Pro 实测暴露接口敏感与停止控制缺陷

第三方测试显示 DeepSeek V4 Pro 对初始提示与工具接口高度敏感,官方 Harness 得分 87.9,第三方仅为 54.68;但 SWE-bench 仍达 96.4%,更像接口锚定而非过拟合。另有开发者用 18 轮长程编码测试(耗 1 亿 token)验证,DeepSeek-V4-Pro-0813 只有 3 次主动调用 finish;不同脚手架与提示均无法解决其停止控制缺陷。

𝕏 GLM-5.3 安全能力大涨:ExploitBench 从 24.4%升至 54.4%

GLM-5.3Cursor中发现“潜在严重漏洞”,CyberGym 得分84.5%ExploitBench从 24.4%升至 54.4%,主要依靠后训练扩展。

𝕏 AlphaSense 研究:Kimi 单次问答成本高于 Anthropic,token 效率是关键

AlphaSense研究发现Kimi虽每 token 单价更低,但单次问答消耗 token 更多,实际成本高于Anthropic;检索、停止行为决定总账单。

💹 千问办公首发上线 GLM-5.3 和 DeepSeek V4 Pro

千问办公首发上线GLM-5.3DeepSeek V4 Pro,支持三款国产旗舰模型。

𝕏 Qwen 3.8-27B 开源:3090 可运行,多项能力追平 Opus 4.6,算力接近 MiniMax M3

Qwen 3.8-27B 开源模型发布,单张 3090 可跑,多项能力追平 Opus 4.6,仅长程推理落后,定价权向开源转移。其 27B 密集模型算力接近 MiniMax M3,消费级硬件可运行,并非小模型。

𝕏 Anthropic 发布 8 月风险报告:防蒸馏成常规工程

Anthropic风险报告显示模型代际跳跃收窄防蒸馏成常规工程,基准评估精度不足。

𝕏 Yutori Navigator 模型:推理快 2 倍、成本低 4-5 倍

Yutori浏览器代理模型达到前沿性能,推理速度提升2 倍,成本降4-5 倍


EVENT-DRIVEN INTELLIGENCE

免费先跟踪重点,再决定是否升级

每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件建立复访,再决定是否升级到更深的追踪能力。