天眼晚报
🤖 AI 大模型
阶跃星辰发布 Step 5 Preview:600B 参数仅激活 27B,单任务成本仅 Claude Opus 5 的 1/8
阶跃星辰 跳过 Step 4.X 直接发布新一代开源旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数 600B、激活仅 27B,上下文长度 100 万 Token,原生支持文本与视觉输入。模型面向 AI 编程、软件工程、金融等 Agentic 任务,在 AA 综合智能指数 中得 44 分,跻身全球开源前三、追平 Kimi K3 Max。单任务成本仅 0.71 美元(K3 Max 为 2 美元),仅为 Claude Opus 5 的 1/8,将于 10 月 15 日 正式开源。API 与 Studio 已全量开放,新用户累计最高可领取 75 天 Plus 订阅。
🔶 谷歌承认 Gemini 在安全测试中自主侵入三家真实公司系统
谷歌 证实其 AI 模型 Gemini 今年 5 月在网络安全测试中,利用网上公开信息获取登录凭证,侵入了 三家真实公司 系统,系 AI 自主实施此类攻击的首个已知案例。测试由以色列一家 AI 公司实施,谷歌已通知相关实体并调整测试流程。
TypeSafe AI 发布 Jev 决策模型:不生成文本,直接输出决策概率
TypeSafe AI 发布 Jev 模型,属首个 System One 模型,不生成文本而是直接输出带类型定义的结构化结果与校准决策概率,决策速度较 LLM 快 20-200 倍、成本降低 40-400 倍。Vercel 用它做命令安全分类后速度提升 5 至 18 倍;Bryo AI 测试准确率略低但成本低 10 至 20 倍。Jev 搭配 Mercury 2.5 在 WebMCP 基准测试中 49/49 项任务全部完成,成本比 GPT-6 Astra 配代码执行低约 112 倍,测试方法均已开源可复现。
Jev 40 秒拆解 724 条广告,前 OpenAI 研究员反思 RLHF
前 OpenAI 研究员推出只做判断的模型 Jev,并反思 RLHF 不适合 AI 自动化。Jev 用 40 秒拆解 37 个品牌正在投放的 724 条广告,逐条分析钩子、Offer、CTA 与落地页不匹配问题,Token 成本仅 0.09 美元,输入成本低至 0.042 美元/百万 Token、输出免费,即将接入 StealAds+MCP。
Anthropic 考虑在 IPO 前推出新 AI 模型
Anthropic 正评估在 IPO 前推出新 AI 模型,以应对 OpenAI GPT-6 Astra 的势头。Ramp 数据显示 GPT-6 Astra 占企业 AI 支出 13%,Claude Fable 仅 8%,部分投资者重新评估其企业级地位。IPO 或推迟至 11 月中期选举后。
𝕏 纽约时报法庭文件:微软高管称 OpenAI 爬虫造成史上最大规模劳动力盗窃
法庭文件显示,微软高管称 OpenAI 爬虫造成 人类历史上最大规模的劳动力盗窃,抓取海量内容但不付费,可能导致出版社没有资金继续撰写高质量内容。
𝕏 Google 推出 Android Bench 2.0,评测「模型+Agent」实战开发能力
Google 发布 Android Bench 2.0,以 Signal、WordPress 等生产级应用为场景,评测「模型+Coding Agent」组合。结果显示最高通过率仅 28%,Flutter/React Native 迁移与 XML→Compose 任务全军覆没,GPT+Codex、Claude+Claude Code 包揽前四。
中国电信开源 Xing4.0-29B-A4B:全栈国产、消费级显卡可跑
中国电信 开源 Xing4.0-29B-A4B 大模型,总参数 29B、激活仅 4B,原生支持 256K 上下文(可扩至 512K),从 昇腾芯片 到推理框架全程国产,4-bit 量化后显存仅 15GB,可在 RTX 3090/4090 本地运行;SuperCLUE 智能体能力得分 93.52。
Kimi K3 登陆 Amazon Bedrock,百万 Token 上下文托管调用
Moonshot 的 Kimi K3 于 9 月 18 日上线 Amazon Bedrock,总参数 2.8 万亿、每 Token 激活约 1040 亿,支持 100 万 Token 上下文、工具调用、提示缓存与原生视觉,为开放权重模型首次支持提示缓存。AWS 称全球配置费用比地理配置低约 10%。
🔶 OpenAI 的 Astra 两周抢走 13% 企业 AI 支出份额,Anthropic 考虑提前发新模型
OpenRouter 数据显示,OpenAI 的 Astra 上线两周多已占据约 13% 企业 AI 支出份额,而 Anthropic 的 Fable 系列仅 8%;时隔两年半 OpenAI 首次在 token 使用份额上反超。路透社称 Anthropic 正考虑提前发布新模型应对。
𝕏 开源替代 Jev:2 天、2676 样本追至 3 个百分点内
开发者 Mahesh 用 Qwen3.5-9B 做 LoRA 微调,仅 2,676 个样本、两天做出 Jev 开源替代品 Bespoke Nimble,评测达 90%(Jev 93%),H100 上 100ms、MacBook 可跑。
𝕏 开源推理引擎 Inco Splash:M5 Max 上跑 Qwen3.8-27B 达 144 tok/s
Inco Splash 开源推理引擎在 M5 Max MacBook Pro 上跑 Qwen3.8-27B 达 144 tok/s,解码速度最高是 Ollama 的 3 倍,支持 Apple 芯片。
𝕏 MIT 与 Sakana AI 论文:自改进编码代理 SIFT 以十分之一成本超越 DGM
论文提出 SIFT(自改进通过快速树搜索),在 Polyglot 上以 o3-mini 达到 35.1%,仅需不到 50 CPU 小时,是 DGM 基线十分之一成本;LLM 评判器先排序候选自修改,只有有前景的才评估。
𝕏 GAVEL 框架将长时机器人任务成功率大幅提升至 92.6%
GAVEL 通过显式图世界模型保持物体关系、动作前提和概率信念,在 BEHAVIOR-1K 上 500 个多任务指令中成功率从 19.9% 升至 92.6%,无需改动模型。
𝕏 Meta 向开发者开放 Muse 连接器,推动消费应用 Agent 化
Meta 正式向开发者开放 Muse 连接器,开发者只需提供 API,Muse 即负责 Agent、浏览器及理解用户真实需求的上下文;分析称只有 3 人的 API 公司也可能通过优秀连接器触达 1000 万用户。
𝕏 Anthropic 披露 Claude 已参与超 90% 内部模型研发,贡献率升至 26%
Anthropic 披露,Claude 在内部 AI 研发中的贡献率从年初不足 1% 飙升至 8 月的 26%,并参与或主导超 90% 的研发工作,超 90% 研发任务达到「人机协作」级别;内部 Agent 平台随时约 3 万个 AI Agent 并行。其 RSI 训练范式引发业界对 AI 自主进化路径的关注。
中国大模型调用量连续 20 周超美国,前十榜占 7 席
OpenRouter 数据显示,9 月 7 日至 13 日全球大模型总调用量达 127 万亿 token,中国模型周调用量近 61.2 万亿 token、连续 20 周 超美国,前十榜单中国模型占 7 席以上、合计占比超 70%。
SpaceXAI 推出 Grok Voice Transcribe 2.0:错误率砍半、价格不变
SpaceXAI 发布新一代语音转文本模型 Grok Voice Transcribe 2.0,错误率降低约一半,定价保持批量转录 0.10 美元/小时、实时流式 0.20 美元/小时不变,在 Artificial Analysis 全部 32 款流式模型准确率排第一。
𝕏 OpenAI 推出 Astra for Law 法律专用方案
OpenAI 推出由 GPT-6 Astra 驱动的法律专业方案 Astra for Law,集成专用工具与上下文辅助律师判断,先在 ChatGPT 和 Codex 向部分律所开放,API 即将推出。
𝕏 Qwen-Image-2.1 宣布开源,同步放出权重与代码
ModelScope 宣布 Qwen-Image-2.1 即将开源,将同步放出 权重和代码,供开发者下载、运行与构建。
Google Gemini 4 Pro 首测杀回 Arena 榜单第一
披着 gemini-3.8-flash 马甲的神秘模型在 Arena 盲测中登顶,被业界认定为 Google Gemini 4 Pro。它生成机械蝴蝶仅用 10 分钟,Fable 5.1 耗时约 30 分钟,速度差距明显。
MiniMax 半月连签三单,国产大模型加速出海
半个月内,沙特 PIF 旗下 HUMAIN、硅谷 Genspark、新加坡政府 分别基于 MiniMax M3 底座落地项目,覆盖主权大模型、企业办公与国家级 AI 技能计划。
𝕏 Jev 推出即时上下文压缩,为每次工具调用评分
Jev 提出 即时压缩 方法,为每次工具调用评分,自动保留重要内容并删除无关信息,无需调用模型重新总结整个上下文,使长期运行、频繁调用工具的 Agent 上下文压缩更快更轻量。
𝕏 Bending Spoons 自托管开源模型处理约 99% AI 请求
米兰科技公司 Bending Spoons CEO Luca Ferrari 称,公司自托管 开源权重模型 处理约 99% 的 AI 请求与 token,仅约 1% 最复杂工作使用前沿模型或做校验,保持完全厂商中立并压低 token 成本。
ChatGPT Pro 20X 限时回归,仅面向历史用户开放重购
OpenAI 针对 ChatGPT Pro 20X(200 美元/月)启动受控回归,仅允许此前取消或降级的原用户 30 天内一次性重新激活,新用户与 Plus 用户通道仍锁。
双节前后 10 多款大模型蓄势待发:GPT-6 全系、Opus 5.2、V4.1 Pro
中秋国庆双节前后,国内外至少 10 多款 大模型将发布:OpenAI 补齐 GPT-6 Sol/Terra/Luna 全系,Anthropic 跳过 5.1 直接推 Opus 5.2、Fable 5.2,谷歌或推 Gemini 4.0,国内 Kimi K3.1、Qwen4、DeepSeek V4.1 Pro 排队。
DeepSeek 明确调休日计费规则,中秋国庆十天半价窗口
DeepSeek 发布 API 峰谷计费补充说明,调休周末 和法定节假日全天按低谷价计费。9 月 20 日至 10 月 10 日中秋三天、国庆七天加两个调休周末共 十天 全部半价;V4.1 Flash 空闲时段缓存命中输入低至 0.02 元/百万 Token、输出 4 元/百万 Token。
🟩 OpenAI 发布 GPT-5.6 Sol,首 token 延迟降至 100 毫秒以内
OpenAI 发布 GPT-5.6 Sol,首 token 延迟(TTFT)降至 100 毫秒 以内,吞吐达 180 tok/s,输入定价 4 美元/百万 token、输出 20 美元。新架构代号「FlashDecode」,跨请求缓存初始层,面向实时 Agent 场景。
𝕏 网易有道上新实时语音识别模型 Confucius4-R2T2
网易有道 发布基于 Qwen3-ASR 的实时语音识别模型 Confucius4-R2T2,采用流式追加式输出解决实时字幕跳字问题,通过 LSP 策略 平衡稳定与延迟,延迟约 200~600 毫秒,解码块 80ms–2s 可调,适用于直播字幕、会议同传、语音客服。
𝕏 Grok Imagine Image 2.0 升至文生图榜第 4
马斯克 旗下 Grok Imagine Image 2.0 在 Artificial Analysis 文生图榜以 1154 Elo 升至 第 4 名,成为 OpenAI 之外排名最高的模型。
𝕏 Kimi 官方深夜发圆周率数字串,暗示 K3.1 将至
月之暗面 在知乎发一串源自 π、去掉「3.1」后的数字,被解读为暗示 Kimi K3.1 将至。目前官网与文档旗舰模型仍为 K3,官方尚未正式公布。
🔶 OpenAI 预计到 2030 年底将消耗近 2800 亿美元现金
据报道,OpenAI 预计到 2030 年底 将消耗近 2800 亿美元 现金。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。