天眼晚报
🤖 AI 大模型
𝕏 OpenAI 发布 GPT-6 Astra 模型,宣告进入 AGI 时代
OpenAI发布GPT-6 Astra,首次在10 万+ GPU集群上训练,支持复杂开发、高难度推理和计算机操作,宣告进入 AGI 时代。API 定价为输入 10 美元/百万 token、输出 50 美元/百万 token,均为 GPT-5.6 Sol 的2.5 倍;同时宣布已达成“自动化 AI 研究实习生”里程碑。
OpenAI 首度公开“自动化研究实习生”进展:AI 工作量达人类 3.1 倍
OpenAI官方首次披露**递归自我改进(RSI)**内部数据:研究部门每消耗 1 个人类工作日,AI 智能体产出3.1 倍工作量;研究员日均 AI 推理支出中位数超600 美元,前 10%用户超 7000 美元,用量较年初增长 124 倍。公司宣布已达成“自动化 AI 研究实习生”目标,可在人类监督下独立完成科研任务,计划 2028 年 3 月前实现“自动化 AI 研究员”。首席科学家 Jakub Pachocki 同日警告,尚无实验室能在 AI 对齐与监控上做到足够可靠。
Anthropic 11 个月锁定 5170 亿美元算力,仍落后 OpenAI 30GW 目标
据 The Information 统计,Anthropic过去 11 个月签约锁定14.8GW算力,未来十年潜在总支出高达5170 亿美元;其年化营收已超 650 亿美元、领先 OpenAI 的 400 亿,但算力储备仍低于 OpenAI 规划的 30GW 目标。
IFM 发布 K2 Horizon 开源模型系列,375B 旗舰领衔
IFM发布K2 Horizon开源系列,包含六款参数从0.9B 至 375B的模型,均采用Apache 2.0协议,开放训练数据与代码,预训练约 20 万亿 tokens,号称史上最大规模全开源发布。
⭐ 黄仁勋:GPT-6 Astra 用 10 万+ NVLink72 训练完成,AGI 已到来
黄仁勋发文确认,GPT-6 Astra由 10 万+张 GB NVLink72 集群完成训练,称“AGI 已到来”,并透露下一批40 万张 GPU即将上线。
英伟达 129 亿美元收购 Hugging Face
英伟达宣布以129 亿美元收购开放模型平台Hugging Face,预计 2027 年上半年完成,将向模型分发、开发者生态延伸,引发对其中立性的担忧。
𝕏 ⭐ 腾讯混元发布 Hy4 预览版,多智能体协作能力大幅提升
腾讯混元发布Hy4 preview,在需控制游戏角色及 SubAgent 协作的多智能体测试中展现团战和堵门策略。后端 Agentic Coding 测试得分从 Hy3 的 16 分跃升至10779 分,提升超670 倍。
华为发布麒麟 9050 Pro 芯片,首款完整“韬定律”芯片落地
华为发布Mate XT 2,搭载麒麟 9050 Pro芯片,采用灵犀 CPU 架构,多核性能提升52%,是首款完整采用“韬定律”逻辑折叠技术的高性能芯片。
GPT-6 Astra 首批实测:24 分钟重建杭州 3D 场景,写作能力退步 80 Elo
GPT-6 Astra首批实测显示其在空间重建和自主代理任务上表现最强:开发者 24 分钟生成可交互 3D 杭州场景,45 分钟完成完整 3D 游戏,还有人一天内完成 12 人联机射击游戏;但 GDPval-AA 写作基准较前代 Sol 下滑约80 Elo分,API 定价为每百万 token 10/50 美元。
MiniMax M3“入籍”沙特,中国开源模型拿下国家级大客户
MiniMax M3开源模型被沙特阿拉伯采用,标志着中国开源模型在主权 AI领域取得突破,也正在将中国开源模型带入更大的海外市场。
DeepSeek 计划采购 16 万颗华为昇腾 950DT 芯片,订单约 25.6 亿美元
据彭博社报道,DeepSeek计划在内蒙古乌兰察布建设吉瓦级智算中心,部署至少16 万颗华为昇腾 950DT 芯片,订单总额约25.6 亿美元,将成为规模最大的国产 AI 芯片集群之一。
谷歌发布 Gemini 3.8 Flash,长程软件工程跑分逼近 Claude Opus 5
谷歌发布Gemini 3.8 Flash及网络安全专用版,DeepSWE v1.1 跑分达71.0%,六周内连续推出三代 Flash,瞄准长程 Agent 任务。
Meta 发布 Muse Glimmer 开源模型,30B 参数可本地常驻运行
Meta开源Muse Glimmer(30B 稠密多模态模型),量化后可在一张24GB 显卡本地常驻运行,Apache 2.0 协议。
中国 AI 大模型周调用量连续 19 周居首,腾讯混元登顶
OpenRouter 数据显示,上周中国 AI 模型调用量达56.72 万亿 Token,环比增 2.83%,连续 19 周超过美国;腾讯混元 Hy4 preview以14.7 万亿 Token登顶,环比增长379%。
𝕏 蚂蚁集团开源金融增强模型 Ling-3.0-flash-Fin,信源可追溯
蚂蚁集团开源金融增强模型Ling-3.0-flash-Fin,基于124B MoE架构、激活 5.1B 参数,支持 256K 上下文并可私有化部署。模型可读财报、估值和处理复杂表格,回答可追溯至具体财报与监管文件,FinFIRST 信源验证得分82.45%。
微软发布 MAI-Image-2.6-Flash:速度提升 2.8 倍、成本降超 50%
微软发布轻量化图像模型MAI-Image-2.6-Flash,速度达 GPT-Image-2-Medium 的2.8 倍,每百万 Token 输出价格降至19 美元,较旗舰版推理成本与 API 定价降超 50%,已开放公测。
𝕏 实测 GPT-6 Astra 与 Claude Fable 5.1:15 个真实任务 Astra 胜 10 场
开发者用同一批业务数据对比GPT-6 Astra与Claude Fable 5.1,覆盖报告、财务、视频、建站等 15 个场景,Astra 赢10 项、Fable 赢 5 项。Astra 总成本便宜约186 美元,浏览器操作明显更强,但长文档与复刻类任务 Fable 更完整。
𝕏 AI 应用市场半年报:豆包月活 3.82 亿居首
QuestMobile 报告显示,2026 年 6 月豆包以3.82 亿月活居首,千问和 DeepSeek 分别为 1.67 亿和 1.29 亿;豆包深度用户占比达 27.5%。
🔶 腾讯混元专项优化 Hy4 preview 模型长思考问题
腾讯混元联合 WorkBuddy 团队更新Hy4 preview:针对复杂任务下的长思考、过度自我验证做了专项优化并全量上线,在不损失效果的前提下明显降低任务轮次及token消耗。
🔶 智象未来发布具身世界模型 HiDream-O1-Embodied,评测登顶
智象未来发布具身世界模型HiDream-O1-Embodied,在RoboColiseum扰动适应评测以0.692 分登顶。
𝕏 AI 先驱施米德胡伯反驳:递归自我改进算法自 1987 年已存在
施米德胡伯回应“RSI 只会在前沿 AI 实验室出现”的说法,指出具体递归自我改进(RSI)算法已有近四十年历史,并附 1987 年以来的原始论文链接。
GPT-6 Astra 基准成绩反复修改引争议 OpenAI 面临“刷榜”质疑
OpenAI在GPT-6 Astra发布后多次修改幻觉率等基准分数(4.2%→2%→4.2%),Anthropic 部分成绩也被改动,引发 AI 界对基准测试可信度的质疑。
谷歌发布 Lyria 3.5 音乐生成模型,登陆 Gemini 应用
谷歌发布音乐生成模型Lyria 3.5,官方称其为目前效果最佳的音乐生成模型,现已登陆Gemini应用。
𝕏 研究:用 RL 可提升 LLM 自我建模能力,但模型仍不具备内省
新基准评估LLM 自我建模能力,用合成数据+强化学习可提升开源模型成绩,但作者否认这证明模型拥有内省能力。
𝕏 AI 先驱 Schmidhuber:LLM 远未达到 AGI,只适合“桌面工作”
Jürgen Schmidhuber称 ChatGPT 等LLM只是人类已有知识的自然语言索引,可替代文员、制图等桌面工作,却难以匹配水管工、电工等物理世界职业,真正的AGI远比 LLM 困难。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。