天眼早报
🤖 AI 大模型
𝕏 阿里巴巴发布 Qwen3.8-Max,2.4T 参数开源权重下周上线
阿里巴巴发布 Qwen3.8-Max,拥有 2.4T 参数,支持 100 万 token 上下文。该模型在 SWE-bench 上得分 87.3%,超越 GPT-5.5。API 定价为输入 $2.0/M、输出 $6.0/M,且 2.4T 参数版本将首次以 开源权重 形式发布。
𝕏 OpenAI 内部模型在数学与理论计算机领域取得 10 项突破
OpenAI 内部模型解决 10 个数学难题,利用约 2000 美元的 GPT-5.6 Sol API 费用完成了长期未解的突破,涵盖球体堆积、编码理论及量子复杂性等领域,并发布了形式化 Lean 证书供学术界审查。
𝕏 MiniMax H3 开源视频模型发布,登顶 Video Arena 榜首
MiniMax H3 发布开源权重视频模型,登顶 Video Arena 榜单:支持 33B 参数多模态理解,可生成 2K 视频并输出原生立体声。在消费级显卡(如 RTX 3060)上运行成本仅为 Seedance 2.0 的 1/3,本地部署 API 费用为 0。总分 1455 分,领先第二名 280 分;图像转视频任务得分 1476 分,仅落后 Dreamina Seedance-2.0 2 分。其 开源协议 包含收入歧视条款,明确禁止美国、欧盟、英国、韩国等地区直接使用,需签署额外协议合规。
𝕏 Cloudflare Agents Week 首日发布 Computer 运行时,支持 gRPC 与 TCP
Cloudflare 启动 Agents Week,发布 Computer 运行时:基于 SQLite 持久化存储,动态在 Isolate 和 Linux 容器间切换,为 AI Agent 提供独立计算环境。同时为 Workers 和 Containers 原生支持 gRPC 及入站 TCP 连接,支持 Python Workers RPC,并上线 Billable Usage API 以追踪 AI 代理成本。
𝕏 Intology Locus 系统自动训练模型超越人类微调版本
Intology 的自动化研究系统 Locus 成功后训练 Qwen3 基础模型,得分 51.6%,超越了官方人类微调版本的 49.4%。该系统在 PostTrainBench 基准测试中达到 SOTA,并通过扩展计算预算至 4500 H100 小时实现了这一突破。
𝕏 TokTier 实现状态化分词,推理首字延迟降低 437 倍
TokTier 实现状态化分词,推理首字延迟降低 437 倍。通过增量修复技术,首字时间从 100K 到 3M 字符仅需 0.5-1.1ms,比 HuggingFace 快 437 倍;在 vLLM 下,中位数首字延迟降低 16-34%,单 GPU 可支撑 1,821 QPS。
𝕏 Cline SDK 揭示开源模型优于闭源模型的 RL 训练机制
Cline 框架让开源模型效率提升 20%:其团队分享开源 Agent 框架为何能更好地发挥 DeepSeek 等开源模型优势——这些模型经过 RL 训练,倾向于消耗更多 Token 进行自我验证,而 Cline 允许模型按训练方式运行。
𝕏 Dreamina Seedance 2.5 全球上线,全家族价格降至历史最低
Dreamina 正式向全球发布 Seedance 2.5 视频模型,并宣布其完整 Seedance 家族在平台上的价格降至 历史最低。该更新解决了 AI 视频实验成本高的问题,支持更复杂的创意生成。
𝕏 Zero-Mem 论文:移除记忆步骤中的 LLM 调用,成本降 57.6%
Zero-Mem 研究将记忆操作时间成本降低 57.6%:该方法提出一种无需生成式 LLM 的记忆架构,仅在读阶段调用模型,在保持长上下文问答准确率的同时适用于生产环境。
𝕏 Cursor 新增 Google Workspace 插件,Agent 可直接操作邮件日历
Cursor 推出新插件,允许 Agent 直接操作 Google Workspace 中的 Gmail、Drive、Calendar、Docs 和 Sheets 任务,无需 API 即可跨应用自动化操作。
𝕏 OpenRouter 推出 Ori Eval 工具,简化 AI 评估流程
OpenRouter 推出 Ori Eval CLI 工具,允许开发者通过自然语言描述 Bug 自动生成测试用例,验证模型表现并集成至 GitHub Actions,解决多模型任务适配难题。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。