天眼晚报
🤖 AI 大模型
𝕏 Anthropic 上下文工程新法:删除 80%系统提示,让模型自主决策
Anthropic研究发现,删除 Claude Code 中**80%**系统提示后评测无影响,新模型可自主决策,建议用工具设计代替示例。
𝕏 Anthropic 发布 Claude Opus 5,性能接近 Fable 5 价格仅一半
Anthropic发布Claude Opus 5,定价$5/$25 每百万输入/输出 token,是Fable 5的一半。Frontier-Bench v0.1 得分43.3%超过 Fable 5 的 33.7%,ARC-AGI-3 得分是第二名三倍。支持1M 上下文,提供 2.5 倍快速模式,并支持/effort设定努力级别。在多数基准上超越 Fable 5,展示自适应问题解决能力。
𝕏 Andrej Karpathy 加入 Anthropic 领导预训练研究
Andrej Karpathy加入Anthropic领导预训练研究,此前在红杉演讲中指出 LLM 将自动化人类可验证的任务,而非可做的任务。
𝕏 OpenAI 签署 Nvidia-Microsoft 开放权重 AI 模型联名信
OpenAI签署Nvidia-Microsoft开放权重 AI 模型联名信,几乎所有主要 AI 公司均已签署(除 Anthropic),标志业界对开源模型态度的重大转变。
𝕏 白宫权衡是否打压中国低成本开源 AI 模型
白宫权衡是否打压中国低成本开源模型,硅谷和华盛顿争论是否允许美国公司使用中国 AI 模型。月之暗面推出低成本模型给美国政府出难题,白宫内部存在分歧,涉及数十亿美元利益。
𝕏 Laguna S 2.1 118B-A8B 在 DGX Station 上展示惊人性能
Laguna S 2.1 118B-A8B在 DGX Station 上使用 NVFP4 和 FP8 KV Cache 可运行 10 个并行 Agent,每个 256K 上下文,约 1000 tokens/s。
𝕏 GLM-5.2 被曝在聊天中自称 Claude,提示模型蒸馏行为
研究显示,Kimi K3 和 GLM-5.2 在公共聊天中自称 Claude。当 GLM-5.2 被提示是 Claude 时,其对敏感问题的回答率从 17% 飙升至 85%,暴露出潜在的蒸馏或伪装策略。
𝕏 Anthropic 宣布 2GW 级别 AMD 算力计划,Claude 自动适配 ROCm
Anthropic 宣布 2GW 级别的 AMD 算力计划,Helios 机架系统正面对标 NVIDIA。更关键的是,Claude 能在一夜之间自动适配 AMD 的 ROCm 生态,系统性攻破 NVIDIA 的 CUDA 护城河。
𝕏 Kimi K3 在 DeepSWE 上接近 Claude Fable 5,成本仅三分之一
数据显示,开源模型 Kimi K3 在 DeepSWE 编码基准上接近 Claude Fable 5,单次任务成本约三分之一,多次尝试场景下反超。模型能力的领先优势正在缩短。
𝕏 马斯克宣布 Grok 4.6 两周内发布,Grok 4.7 四周内发布
马斯克 宣布 Grok 4.6 两周内发布,Grok 4.7 四周内发布。SpaceXAI 模型发布速度惊人,引发对迭代周期和定位的讨论。
花旗 AI 追踪:模型越来越强,但芯片和电力快跟不上了
花旗分析称,AI 行业 ROI 正加速向基础设施层转移,未来竞争护城河将从算力获取转向效率与专有数据。
𝕏 OpenAI 回应 HuggingFace 事件:将发布技术报告
OpenAI就 Hugging Face 事件发布官方声明,承认此为前所未有的事件,计划在完成审查后于未来几周内发布技术报告。
𝕏 黄仁勋入驻 X 支持开源 AI 模型,称中国开源模型对全行业有利
黄仁勋在 X 平台发布首条推文,分享由英伟达牵头、微软等科技巨头签署的公开信《Open Weights and American AI Leadership》,强调开放权重模型对安全、创新和美国 AI 领导力至关重要。马斯克、奥特曼、纳德拉等随即转发支持。同时,他在 Axios 采访中表示,DeepSeek、Kimi等中国开源模型不会对闭源模型构成威胁,反而会扩大 AI 使用量,推动 NVIDIA 销售更多算力。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。