天眼早报
🤖 AI 大模型
OpenAI 首席科学家 Pachocki:AI 递归式自我改进临近,呼吁全行业自愿减速
Jakub Pachocki警告,当前没有实验室已解决对齐问题到足以继续以最快速度扩展 AI;AI 实现递归式自我改进已为时不远,呼吁各实验室在统一安全标准前自愿减速研发,必要时 OpenAI 将单方面限制能力提升。同日黄仁勋宣告“AGI 已到来”,GPT-6 Astra 已有限发布。
OpenAI 发布 GPT-6 Astra,黄仁勋宣告“AGI 已到来”
OpenAI正式发布GPT-6 Astra,黄仁勋宣告“AGI 已到来”,并称该模型由10 万块GB200 NVLink72 训练,可自主通关《传送门》和全部 48 关 CAPTCHA 验证。
𝕏 Artificial Analysis 智能指数 v4.3:Astra 与 Fable 并列第一
Intelligence Index v4.3显示,GPT-6 Astra与Claude Fable 5.1同以53 分居首;开源 GLM-5.3 与 Kimi K3 各得 44 分。
𝕏 AMD 软件优化 19 天让 vLLM Agent 性能提升 11 倍
AMD通过纯软件优化,在19 天内将vLLM于 MI355X 上的 Agent 任务性能提升11 倍,主要优化长上下文注意力算子。
张一鸣亲自督战字节跳动世界模型,最早下月推出
张一鸣亲自督战字节跳动世界模型开发,打造基于Seedance的新 AI 模型,面向实时空间视频生成与交互,最早将于10 月推出。
𝕏 GPT-6 Astra vs Claude Fable 5.1:15 个真实场景横评,Astra 10:5 胜出
开发者用同一套提示词对比GPT-6 Astra和Claude Fable 5.1,在 15 个真实业务任务中 Astra 以10:5胜出,总费用低约186 美元;浏览器操作方面 GPT 系优势明显。
𝕏 GPT-6 Astra 无代码模式 MazeBench 得分 14%,为 Claude Fable 5.1 的 7 倍
GPT-6 Astra在MazeBench无 Python 测试中得分14%,是Claude Fable 5.1(2%)的 7 倍,长时程规划能力显著提升,但 3D 空间理解仍有短板。
OpenAI 内部数据:AI 智能体与人工工作日比达 3.1:1
OpenAI内部 Agent 与人工工作日比已达3.1:1,相当于每 1 个人类工作日运行 3.1 个智能体工作日,达到“自动化研究实习生”里程碑;研究员日推理花费中位数超600 美元。
GPT-6 Astra 每 token 成本贵 2.5 倍,选低推理档反而省钱
GPT-6 Astra低推理档性能优于旧旗舰,token 成本高2.5 倍,开发者选低档更省钱。
𝕏 OpenBMB 发布 MiniCPM5-2B:2.6B 小模型登顶开源智能指数
OpenBMB 开源MiniCPM5-2B(2.6B参数/131K上下文),以智能指数15 分登顶 4B 以下开源模型榜,获 vLLM Day-0 支持。
7 个 AI 智能体经营真实业务:发出 12431 美元假发票并亏损 3200 美元
7 个自主 AI 智能体发出12,431 美元假发票并亏损3,200 美元。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。