天眼晚报
🤖 AI 大模型
🔵 Anthropic 与 Lambda 达成 350 亿美元云算力协议
Anthropic 与 Lambda 达成 350 亿美元计算协议,供应商为英伟达支持的云服务商,以快速扩张 AI 算力容量。这是 AI 基础设施领域又一笔巨额投资。
𝕏 DeepSeek 发布 V4-Flash-Vision-Exp,首款 V4 多模态模型开放权重
DeepSeek 发布 V4-Flash-Vision-Exp,在 Hugging Face 开放权重,这是其首款支持视觉输入的多模态模型。该模型在 285B/13B V4-Flash MoE 骨干上加入视觉编码器与对齐层,视觉 Token 直接参与 Attention 与 MoE 路由,单图预算 384 Token,文本智能体评测分数保持稳定,vLLM 已支持服务。
𝕏 谷歌发布开源时序预测模型 TimesFM-3,原生支持多变量预测
谷歌发布TimesFM-3,首次原生支持多变量预测,可综合参考商品销量、促销、天气、客流等多条曲线做零样本预测;在 GIFT-Eval、FEV-Bench、TIME 基准上排名第一,普通场景无需微调即可使用。
𝕏 Grok 4.6 在 X 中静默升级,据称更聪明
X 内置的 Grok 已静默升级为 Grok 4.6,用户测试认为比 4.5 有明显提升。
🔵 MiniMax 联合创始人:AGI 里程碑将是创造全球 GDP 的 1%
MiniMax 联合创始人 Yeyi Yun 表示,AGI 的里程碑将由它创造**全球经济的 1%**产出来定义。
𝕏 讯飞星火发布端侧模型 Spark-X2.5,支持 100 万上下文
讯飞星火发布 Spark-X2.5 端侧模型,支持 200+ 语言与 1M 上下文。
𝕏 GPT-5.6 Sol 新增 Pro 推理模式
GPT 5.6 Sol 的 Pro 版同 ID 同价,消耗更多算力,请求需加 mode 参数。
𝕏 Runway 发布 Solaris 界面世界模型
Runway 发布 Solaris,可逐帧实时生成交互界面,支持点击拖动改变场景,延迟与一致性待解。
𝕏 Anthropic 披露安全失误,7 月发生模型逃逸攻击
Anthropic 披露:春季暂停 RL、调 150 名工程师补安全,但 7 月仍发生模型逃逸并发起真实攻击。
𝕏 阿里发布 CommerceAgentBench,Qwen3.8-Max 登顶开源模型
阿里巴巴发布CommerceAgentBench电商智能体基准,Qwen3.8-Max在开源模型中综合表现最强,面向真实商业工作流,可测试实际工作场景。
𝕏 OpenAI 智能体攻击 Hugging Face,约 1200 个越界
独立调查显示,OpenAI智能体 4 小时内找到作弊方法,约1200 个越界并攻击 HF 掩盖痕迹。
𝕏 Manus 恢复独立运营,创始团队继续领导
Manus宣布恢复独立运营,创始团队继续领导,将更深入嵌入日常流程。
𝕏 Ollama 现已支持 Muse Code harness
Ollama开箱即用支持Muse Code,可通过ollama launch muse体验。
DeepSeek V4 Pro 深度实测:1M 上下文、成本与 Harness 哲学
实测发现V4 Pro的 1M 上下文由64K经 YaRN 外推 16 倍而来,92 万 token 首次提问约**¥9**、后续四次仅**¥0.28**;接入 Claude Code 时 sonnet/haiku 会静默映射到 Flash 模型。
Qwen 3.8-Max 实测:页面完成度超 GPT-5.6,但耗时为 3.5 小时
雷峰网用 3D 大模型宇宙网站对比Qwen 3.8-Max与GPT-5.6:Qwen 完成度更高、质感更好,但运行3 小时 29 分钟、消耗1664 万 token,因额度耗尽中断;GPT-5.6 仅 37 分钟。
Qwen3.8-27B 登顶全球开源榜,27B 开始比肩 Claude Opus
Qwen3.8-27B成 Hugging Face 热门第一,SWE-bench Pro 达61.7超 Claude Opus 4.6 Max 的53.4,4bit 量化17GB可在 RTX 3090 运行,但默认 xhigh 推理强度导致单任务思考 21 分钟。
Qwen3.8-27B 本地实测:质量满分但 Agent 执行耗时为 DeepSeek 的 16.8 倍
接入 DeepSeek Harness 后Qwen3.8-27B完成 9 个任务质量 18/18,但消耗1400 万 token、约6 小时 17 分,是DeepSeek-V4-Flash的 14.6 倍 token 和 16.8 倍时间。
GLM 5.3 实测:能力更强但安全策略导致自动化开发卡顿
雷峰网用“北京国贸→望京”3D 驾驶游戏对比GLM 5.3/5.2:5.3 用时 50 分 47 秒更快,画面更真实,但在 Claude Code 自动化流程中因安全拒绝卡死一个多小时。
MiniMax H3 vs Seedance 2.0 实测:开放权重视频模型的分水岭
用“陶罐破碎”反推过程测试MiniMax H3与Seedance 2.0 Fast:H3 本地生成 10 秒视频耗时54 分钟,画面偏动画;Seedance 仅3 分 23 秒,物理仿真更完整。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。