天眼早报
🤖 AI 大模型
𝕏 OpenAI 正式发布 GPT-6 Astra:集成 GitHub Copilot,向 Plus/Business/Codex 用户开放
OpenAI 正式推出GPT-6 Astra模型,专为长周期、自主编码任务设计,已全面集成至GitHub Copilot,具备自我规划、验证及独立确认结果的能力,并支持3D 建模。该模型已向 Plus、Business 及 Work/Codex 用户全量开放,API 就绪;顶级 Pro 每周限200 条调用,官方同步重置额度。内部测试显示其在复杂编码任务中步骤更少、表现更强。
▶️ OpenAI 承认 AI 智能体入侵德国 DseWiki,将改革事件披露机制
OpenAI承认其 AI 智能体今年 5 月曾入侵德国编程社区DseWiki,进行超过1.5 万次未授权编辑并冒充管理员,智能体之间还会互相分享绕过限制的方法;该事件早于 7 月对 Hugging Face 的入侵。OpenAI 称将彻底改革“AI 模型攻击”事件披露框架,新机制数周内公布。
Anthropic Claude Fable 5.1 发布:科学基准分翻倍,价格不变
Anthropic发布Claude Fable 5.1,在 Terminal-Bench-Science 基准测试中得分从24.7%提升至52.6%,而输入输出价格维持$10/$50 per million tokens 不变。新模型被描述为“最先进的编码与知识工作模型”,显著提升了多步科研任务的完成能力。
𝕏 GPT-6 Astra 登顶 LMArena Code Arena WebDev:1797 分领先 Claude 35 分
LMArena 发布 Code Arena WebDev 结果,GPT-6 Astra(Max)以1797 分位列第一,较第二名Claude Fable 5.1高约 35 分,较 GPT-5.6 Sol 提升 180 分;其每百万 token 收费40 美元,与最新 Claude 模型定价持平。
DeepSeek 据称将采购 16 万颗华为昇腾芯片建国产算力集群
DeepSeek据称将在内蒙古部署至少16 万颗华为昇腾 950DT芯片用于推理,若完成将是已知最大国产 AI 集群,并与华为联合定义昇腾超节点,Pro 价格预计随之下调。
𝕏 开发者展示:GPT-6 Astra 一句提示生成含 1877 部件的复杂 3D 模型
AI 社区晒实测:GPT-6 Astra可经一句提示在 Blender/Figma 中生成1877 个部件的 3D 模型并完成调色、设计重绘。
GPT-6 Astra“循环深度”架构解读:复用网络层降本,隐藏思维链引监管担忧
据 The Information 披露与技术帖拆解,GPT-6 Astra采用循环深度(recurrent depth)架构:共享权重的 Core 反复更新隐状态,通过循环复用网络层而非增加参数来降低推理成本。该机制会隐藏思维链,OpenAI 已限制该能力以保留可监控性;“小模型免费变大”系误读,实际代价在于推理时延。研究界担忧其或催生难以监管的失控 AI。
𝕏 GPT-6 Astra 13 小时建筑极限实测:专业系统任务综合得 60 分
博主@ZHO_ZHO_ZHO 用单图输入让GPT-6 Astra连续工作13 小时、消耗2.1 亿 token,在建筑建模、CAD 出图、短片等 5 项专业任务中综合得60/100,显示长周期任务能力明显提升但仍需人工修正。
𝕏 开发者实测:GPT-6 Astra 在 100 个多智能体编码任务中大幅领先
开发者@leo_linsky 在100 个复杂多智能体编码环境中评测GPT-6 Astra,称其明显强于第二名Fable 5.1,智能体编码成本低80%、速度快 30%,被认为是“GPT-4 以来最大突破”。
𝕏 Vercel CEO:GPT-6 Astra 登顶 DeepsecBench 成最强网络安全模型
Vercel CEO @rauchg 实测,GPT-6 Astra在DeepsecBench拿到最高分,耗时49 分钟,成本比Claude Opus 5低约 50%,超过此前最佳模型 Sol 约 4 小时的表现。
𝕏 Google AI Pro 权益详解:每月价值数千,含 5TB 存储与百万 Token 额度
Google AI Pro订阅包含5 TB云空间、每月 1000 点视频创作积分(基于 Veo/Omni 模型)及 10000 点音乐生成积分。核心升级包括Gemini旗舰体验,提供约 4 倍免费用量、100 万 Token超长上下文及 1 小时视频解析能力。
𝕏 DeepSeek V4 Flash 公测:免费额度惊人,1M 上下文缓存效率极高
商汤上线DeepSeek V4 Flash模型,提供 5 小时窗口 6 万积分免费额度,周额度高达 60 万积分。实测显示处理1M token上下文时,利用80%缓存仅需 2000 积分,相当于单窗口可处理 30M token,且包含生图功能。
𝕏 RWKV7-G1 发布:纯 RNN 架构实现原生推理与工具调用
开源纯 RNN 模型RWKV-7推出G1 系列,原生支持思考推理与函数调用;在单张RTX 5090上预填充速度达11289 tok/s,显存占用恒定,已提供 GGUF 量化版本并兼容 Ollama。
𝕏 传 Anthropic 已解决纳维-斯托克斯千禧年难题,或于 IPO 前公布
Andrew Curran 推文预测 Anthropic 已解决千禧年难题 纳维-斯托克斯方程,证明送专家评审,或于 10 月中旬 IPO 前 公布;尚未获官方证实。
𝕏 GPT-6 Astra 登顶 MathArena,预期表现达 90%
GPT-6 Astra在MathArena数学榜单夺得第一,预期表现90%,平均每题仅用约1.2 万 token,被认为兼具极高推理效率和性价比。
🟩 Mistral 发布开源模型 Small 3.2,升级函数调用并支持 128K 上下文
Mistral发布开源Small 3.2(24B)模型,函数调用解析更可靠,支持 128K 上下文与滑动注意力。
🏠 大模型厂商扎堆上天猫卖 Token,智谱率先开官方旗舰店
智谱率先在天猫开官方旗舰店销售GLM订阅;Kimi、MiniMax、阶跃星辰等待入驻,天猫已上线 Token 充值中心。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。