天眼早报
🤖 AI 大模型
Anthropic 发布 Claude Haiku 5.5,多数请求成本较上代降约 75%–90%
Anthropic 发布 Claude Haiku 5.5,官方称其为史上最便宜、最快、能力最强的小模型,多数请求运行成本较 Claude Haiku 4.5 低约 75%,每百万输入 Token 最低仅 0.1 美元,较上代下降 90%,在 OSWorld 等基准上超过 GPT-6 Luna,支持 100 万 Token 上下文。该模型开始按任务动态分配推理,操作能力显著提升,但复杂编程仍弱于同级模型;当上下文超过 10 万 Token 后,输入输出单价均上涨 5 倍,该阶梯定价细节隐藏于价格页面。
𝕏 OpenAI 为 GPT-6.1 Sol 推出 Ultrafast 模式,最高提速 8 倍
OpenAI 在 API、Codex 和 ChatGPT Work 中为 GPT-6.1 Sol 推出 Ultrafast 模式,速度最高达标准版的 8 倍,接近 Astra 级智能水平,让开发者跟上创意涌现的速度,并加入即时转向控制,使模型可实时响应方向调整。API 定价为输入 12 美元/百万 token、输出 60 美元/百万 token。
𝕏 AI 评测公司 Arena 融资 2 亿美元,发布智能体对齐指数
Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元,同时发布 Alignment Index。该指数基于 9 万+ 真实智能体会话和 27 个 模型,衡量越权操作、虚假归因、欺诈性完成三大风险信号,GPT-6.1-Sol 以 87.9 分 领跑。
𝕏 Odyssey 发布 Odyssey-3 世界模型,Physics-IQ 刷新纪录
Odyssey 发布 Odyssey-3 世界模型,Pro 版在 Physics-IQ Verified 取得 66.1 分创新高。该模型采用自回归扩散 Transformer,Flash 版可将文本实时生成可探索世界,今日免费开放。
OpenAI 面向全球 ChatGPT 用户全面上线 GPT-6
OpenAI 面向全球所有 ChatGPT 用户全面上线 GPT-6。同期消息还包括 博通 计划为 OpenAI 定制芯片项目融资逾 500 亿美元,以及 优必选 与一汽-大众达成战略合作。
𝕏 Claude Haiku 5.5 第三方实测:Code Arena 首秀 1587 分,机器人任务成功率 85%
Claude Haiku 5.5 在 Code Arena: WebDev 首秀得分 1587 分,较 Haiku 4.5 提升 257 分,位列第 30,定价 0.10/0.50 美元每百万 token,与 GPT-6 Luna 同价但高 6 分。在简单机器人任务上,它比 Haiku 4.5 强 17 倍、比 GPT-6 Astra 便宜 51 倍,成功率 85%,每次尝试成本低于 0.02 美元。真实工程任务中,Haiku 5.5(max) 在两个代码库修复 105 个前沿模型漏掉的 bug,得 21.5 分、花费 5.83 美元,而 Opus 5.5 得 36 分花费 34.98 美元,DeepSeek V4.1 Flash 仅 0.31 美元。
🔶 谷歌将 Gemini 改造为企业级 AI 智能体,可跨系统自主执行任务
谷歌云 将 Gemini 升级为面向企业的通用智能代理,可自主规划任务、调用 Gmail、Drive、Docs、Sheets 等内部工具并直接交付成果,还支持在自家模型与 Anthropic Claude 间动态切换、委派子代理,并拥有带邮箱地址的独立职场身份。同步提供权限管理、审计、沙箱及实时支出上限等企业级控制,并首次推出金融、法律行业专业版,标志其从聊天助手迈向数字员工。
JetBrains 发布 Mellum2.1:12B MoE 编码智能体开源模型
JetBrains 发布 Mellum2.1,12B MoE 编码智能体模型,每 token 激活 2.5B 参数,支持 131072 token 上下文,LiveCodeBench v6 得 82.0 分。该模型通过大规模 RL 后训练增强 agentic coding 能力,在相关基准上相对其速度取得最高分,权重以 HF、GGUF 格式及 Apache 2.0 许可开源。
Anthropic 发布 Claude Sonnet 5.5:比 Opus 5.5 便宜 42%,Terminal-Bench 得分更高
Anthropic 发布 Claude Sonnet 5.5,Terminal-Bench 4.0 得分 70.6%,超过 Opus 5.5 的 66.4%。每百万 token 定价 2/10 美元,为 Opus 5.5 的一半,但独立测试显示在最高强度下单任务成本反而更高。
𝕏 OpenAI 为 ChatGPT 推出 Intelligent UI,重构回答形式
OpenAI 以 Intelligent UI 重构 ChatGPT 回答,用可点击按钮、可编辑图表和计算器呈现,GPT-6 可自动选择布局,GPT-6 Instant 比上代提前 44% 开始联网回答。
德国搜索引擎 Ecosia 弃用 Mistral 转向中国开源 AI
德国搜索引擎 Ecosia CEO Christian Kroll 宣布放弃 Mistral 模型,转用 Qwen、GLM、Kimi 等中国开源模型,称 Mistral 已落后竞争对手一年。Ecosia 被德国联邦环境部和英国 NHS 等机构使用。
𝕏 Anthropic 推出 Claude Dashboards 与 Claude Motion 测试版
Anthropic 上线 Claude Dashboards 和 Claude Motion 测试版,用户可让 Claude 将数据转为实时仪表盘、将想法转为动画解说,并支持导出至分析工具和视频编辑器。
Claude Haiku 5.5 上线 B.AI、Cursor 等平台,短请求成本低 10 倍
Claude Haiku 5.5 已上线 B.AI、Cursor 与 YouWare 等平台:在 B.AI 支持 100 万 token 上下文、五档自适应思考、图像理解与工具调用,最高 128K 输出,面向延迟敏感场景;在 Cursor 上处理较短请求的成本比 Claude Haiku 4.5 低 10 倍;YouWare 同时上线 Sonnet 5.5,后者比 Sonnet 5 快 30% 以上,而 Haiku 5.5 消耗额度低于 DeepSeek-V4.1-Flash。
𝕏 阶跃星辰 Step 5 Preview 发布:600B 稀疏 MoE,多平台免费开放
StepFun 发布旗舰模型 Step 5 Preview,稀疏 MoE 架构(27B 激活 / 600B 总计),支持 1M 上下文及文本、图像、视频输入,在 DeepSWE、ProgramBench 等基准上超越 Kimi K3 与 GLM-5.3,跻身最强开源权重代码模型之列。该模型已在 OpenRouter 上线,并在 OpenCode、Cline 等编程助手中免费开放一周,支持零数据保留。
𝕏 Google 发布 Nano Banana 2.1 图像模型,1K 价格减半
Google 发布 Nano Banana 2.1 图像模型,基于 Gemini 3.6 Flash,在文本生图和图像编辑榜单均排名第 4,1K 分辨率每张图 0.0336 美元,为上一代一半;在 AA-Image-T2I v2.0 排名比上代高三档,生成一张 1K 图约 16 秒。新版本同时提升画质、修复上一代多个 bug,已在 API、AI Studio 与 Gemini 应用上线。
𝕏 Opus 5.5 搭配 10 个 Haiku 5.5 子代理:耗时降至 1/3.7、成本降约 70%
落蛋试验中,Opus 5.5 单独运行耗时 3 分 37 秒、尝试 25 个方案、花费 0.47 美元;搭配 10 个 Haiku 5.5 子代理后 58 秒 完成、尝试 86 个 方案、仅花费 0.14 美元,成本降低约 70%。
𝕏 DeepSeek V4 Flash 可在 Windows PC 本地运行
微软展示 DeepSeek V4 Flash(284B 参数 开源模型),量化至 1.6 位后约需 60GB 内存,可在 Windows PC 本地运行;Surface Laptop Ultra 最高 128GB 统一内存可容纳。
𝕏 EmbeddingGemma 2 发布:开源端侧嵌入模型,270m–740m
Google 发布开源嵌入模型 EmbeddingGemma 2,支持代码、图像、视频、音频、文本嵌入,参数从 270m 到 740m,采用 Matryoshka 嵌入与 Apache 2 许可。
Tavus 发布 Griffin-Lite,称首个通过视频图灵测试
旧金山 AI 视频公司 Tavus 发布新模型 Griffin-Lite,54 名受试者一分钟视频通话后 26 人 误以为对方是真人(48%),上一代仅 2.4%,可在双方同时说话时实时打断与附和。
𝕏 OpenAI 内部模型解决 372 个数学开放问题
OpenAI 发布内部 AI 模型产出的 372 个 新数学结果,每个都在数学或理论计算机科学的重大开放问题上取得解决或实质进展。
𝕏 GPT-6 Sol Daybreak Blue 登顶 Artificial Analysis 网络指数
Artificial Analysis 将可信访问模型纳入 Cyber Index,GPT-6 Sol (Daybreak Blue, max) 登顶,全程无安全拦截,总分比公开版 GPT-6 Sol (max) 高 32 分,每任务成本 1.77 美元。
𝕏 Prism ML 将 Qwen 27B 压缩至 6GB,保留 95% 性能
Prism ML 团队将阿里 Qwen 27B 模型的参数从 16 位压缩至 1.5 位,内存占用从约 60GB 降至 6GB,保留 95% 性能,可在树莓派上运行。
OpenAI 为 ChatGPT 和 Codex 嵌入水印 textGrain
OpenAI 在 ChatGPT 和 Codex 中嵌入机器可读水印 textGrain,主要针对欧盟用户以遵守 AI Act,公司称性能与未加水印时相当。
𝕏 开源医疗决策模型 pplx-decider v1.1 击败 Jev
pplx-decider v1.1 在临床决策测试中答对 643/669 题,超过 Jev 的 628 题,单次决策成本低 42%,且权重可下载并在医院内部部署。开发者称 "System One" 正式开源。
𝕏 d1 系列小型决策模型发布:3B 文本视觉、600M 多模态
d1-3B 在文本和视觉任务上表现出色,d1-omni-600M 则支持文本、视觉和音频;后者已在 Apple silicon 上以 Core ML 运行,在 M5 Pro 上每秒审核 224 条 评论、与人评一致率 95.4%。
𝕏 Unsloth 支持将 Qwen/Llama/Gemma 微调为决策模型
Unsloth 推出决策模型微调方案,可将 Qwen、Llama、Gemma 训练为输出有界决策的模型,采用 LoRA 与 4bit 量化,Qwen3.5-0.8B 在约 4GB 显存下达 78% 留存集准确率。
𝕏 腾讯发布 STEPQuant 量化框架
腾讯 研究团队发布 STEPQuant,这是一个针对 Delta-rule 循环状态的空间-时间训练后量化框架,6 位 状态即可匹配 FP32 精度,服务内存最多降低 68.7%。
𝕏 Streams:支持实时人类反馈的多模态在线强化学习
Streams 发布在线强化学习方案,面向多模态模型,支持图像、音频、视频,接入 10 亿+ 评分者提供实时连续人类偏好。
𝕏 Artificial Analysis:输出 token 越多不代表分数越高
Artificial Analysis 测试显示,生成更多 token 不一定得分更高。GPT-6 Astra 每任务约 81k token 得 8.6%,Grok 4.7 约 180k token;三个 Claude 模型生成 token 最多(20 万至 56 万)却仅得 2.8%–6.4%。
𝕏 GLM5.3-flash 本地推理实测:40 tok/s
用户实测 GLM5.3-flash 经 2 天 38 大项测试,在 AMD 9950x + 4090 48G 硬件上达 40 tok/s,prefill 最高约 1043 tok/s。
𝕏 GPT-6 Luna 成为最快 Decisions 模型,延迟 180ms
OpenRouter 报告 GPT-6 Luna 以 180ms 成为全球请求下最快的 Decisions 模型,其次是 Jev 和 Perplexity Decider。
💻 Anthropic 更新使用政策,禁止模型滥用与选举干预
Anthropic 更新使用政策,明确禁止极端情况下的用户滥用 Claude 行为,并新增对选举干预、欺骗性宣传、武器软件和监控的限制;普通的不满与批评仍被允许。
𝕏 Claude Docs、Slides、Design 结束测试,免费版也可用
Claude Docs、Slides、Design 结束测试,向含 Free 在内的所有套餐开放,团队可与 Claude 共同编辑同一文档、演示和设计稿。
💻 Goodfire 推出「由内而外」监控方案,低成本捕捉失控 AI 智能体
Goodfire 推出「由内而外」的监控方案,直接窥探模型内部而非再雇一个 AI 通读智能体全部行为,仅在异常时调用备用审查,成本大幅降低。
🤗 TII 发布语音识别模型 Falcon ASR
TII 在 Hugging Face 发布 Falcon ASR 语音识别模型。
💻 被解雇的 OpenAI 安全研究员发公开信否认指控
三名被解雇的 OpenAI 安全研究员发公开信,否认不当处理敏感信息的指控,警告解雇事件正在制造寒蝉效应,损害公司 AI 安全文化。
Midjourney 在 Alpha 站点测试图像生成新「思考模式」
Midjourney 在 Alpha 站点测试图像生成新“思考模式”,称其可提升提示词准确性、排版与连贯性,并邀请用户参与试用。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。