天眼晚报
🤖 AI 大模型
𝕏 DeepSeek Harness 3 天斩获 12.2 万 GitHub 星,插件化架构引关注
DeepSeek Harness 发布 3 天即获 12.2 万+ GitHub 星,支持模型、工具、存储、调度全部插件化,MIT 许可。分析指出其同期将缓存命中输入价格提高 6-12 倍,与 Agent 工作负载形成矛盾。
𝕏 Anthropic 公布 Claude 文本水印技术:绿色 Token 统计偏差检测
Anthropic 公布 Claude 文本水印方案,基于 SynthID-Text,不影响质量,将开放检测 API。该技术通过固定密钥生成随机种子,从词表选中部分“绿色 token”并提高生成概率,使 AI 文本绿色 token 比例达 70%,高于普通文本的 25%,从而可用于水印检测。
𝕏 西门子测试 Qwen 和 DeepSeek,中国开源模型在欧洲受青睐
西门子 公开在内部 LLM 平台测试 Qwen 和 DeepSeek,本地部署可避免 GDPR 跨境传输问题。但自托管 GPU 成本高,且中国是西门子大市场,采用中国模型有商业考量。
𝕏 Grok 4.6 代理编码效率超越 GPT-5.6 Sol:成本低 35%
实测显示,Grok 4.6 在 3 个构建任务中花费 $13.11,低于 GPT-5.6 Sol 的 $20.18;模型调用仅 201 次 vs 338 次,且 93-98%输入 token 来自缓存。
𝕏 Anthropic CEO 预测 AI 将在 5-10 年内治愈多数人类疾病,呼吁监管
Dario Amodei 称 AI 有望在 5-10 年 内治愈多数人类疾病,并承认 AI 天然趋向集中权力,主张对前沿模型进行部署前测试,认为开源权重无法解决算力垄断问题。
𝕏 阿里 Qwen 全球下载量破 30 亿,衍生模型数量达 Meta 的 2.6 倍
阿里巴巴 称 Qwen 全球下载量突破 30 亿;HuggingFace 上衍生模型 15.1 万个,是 Meta 总规模的 2.6 倍,Llama 仓库的 4.7 倍,已成为开发者微调部署的默认工作流之一。
💹 ChatGPT 新增谷歌云盘文件编辑、AI 测验和 Yelp 推荐
OpenAI 为 ChatGPT 订阅用户推出谷歌云盘文件直接添加与编辑功能,并新增 AI 互动测验工具和Yelp餐厅推荐集成。
𝕏 DHH 用 GPT-5.6 将 Python 屏保重写为 Rust:性能提升 10 倍,体积仅 3MB
DHH 使用 fable5 和 GPT-5.6 将 Python 屏保动效重写为 Rust,性能提升十几倍,编译文件从 20 多 MB 减至 3MB。
𝕏 OpenAI 预览 GPT-5.6 Sol UltraFast 超快模式,速度达标准版 14 倍
OpenAI面向企业预览GPT-5.6 Sol UltraFast,运行速度为标准模式的14 倍,每秒最多生成750 tokens,适用于实时语音、智能体等场景。
𝕏 DeepSeek V4 Pro 实测暴露接口敏感与停止控制缺陷
第三方测试显示 DeepSeek V4 Pro 对初始提示与工具接口高度敏感,官方 Harness 得分 87.9,第三方仅为 54.68;但 SWE-bench 仍达 96.4%,更像接口锚定而非过拟合。另有开发者用 18 轮长程编码测试(耗 1 亿 token)验证,DeepSeek-V4-Pro-0813 只有 3 次主动调用 finish;不同脚手架与提示均无法解决其停止控制缺陷。
𝕏 GLM-5.3 安全能力大涨:ExploitBench 从 24.4%升至 54.4%
GLM-5.3在Cursor中发现“潜在严重漏洞”,CyberGym 得分84.5%,ExploitBench从 24.4%升至 54.4%,主要依靠后训练扩展。
𝕏 AlphaSense 研究:Kimi 单次问答成本高于 Anthropic,token 效率是关键
AlphaSense研究发现Kimi虽每 token 单价更低,但单次问答消耗 token 更多,实际成本高于Anthropic;检索、停止行为决定总账单。
💹 千问办公首发上线 GLM-5.3 和 DeepSeek V4 Pro
千问办公首发上线GLM-5.3和DeepSeek V4 Pro,支持三款国产旗舰模型。
𝕏 Qwen 3.8-27B 开源:3090 可运行,多项能力追平 Opus 4.6,算力接近 MiniMax M3
Qwen 3.8-27B 开源模型发布,单张 3090 可跑,多项能力追平 Opus 4.6,仅长程推理落后,定价权向开源转移。其 27B 密集模型算力接近 MiniMax M3,消费级硬件可运行,并非小模型。
𝕏 Anthropic 发布 8 月风险报告:防蒸馏成常规工程
Anthropic风险报告显示模型代际跳跃收窄,防蒸馏成常规工程,基准评估精度不足。
𝕏 Yutori Navigator 模型:推理快 2 倍、成本低 4-5 倍
Yutori浏览器代理模型达到前沿性能,推理速度提升2 倍,成本降4-5 倍。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。