天眼晚报
🤖 AI 大模型
𝕏 国产大模型期中成绩:Kimi K3 与 GLM-5.3 并列 T1
AA 竞技场中,Kimi K3与GLM-5.3同获 60 分并列 T1,Qwen3.8 Max58 分,文心 5.0仅 22 分。
🟧 Grok 4.6 发布,定位长时运行 Agent 前沿模型
xAI发布Grok 4.6,定位长时运行 Agent的前沿智能模型,当日位列 Product Hunt 产品榜第四。
𝕏 开源模型 Ornith-1.5 发布,提供 9B 至 397B 三规格并支持 vLLM
开源模型Ornith-1.5发布,提供 9B/35B MoE/397B MoE三规格并采用 MIT 许可,全系支持vLLM推理。自报 Terminal-Bench 2.1 得分 86.1、SWE-Bench 86,通过自我改进循环训练,性能接近Claude Opus 4.8。
𝕏 Agent Arena 公布帕累托前沿模型与任务成本
Agent Arena 上线帕累托前沿:Claude Opus 5(+12.34%/$1.78)、Kimi K3(+10.53%/$0.62)、GPT-5.5(+7.75%/$0.44)居成本效率前列,Grok 4.5 仅$0.22/任务。
𝕏 OpenAI 推出零数据保留与 Private Safety Processing,向 Anthropic 抢客户
OpenAI承诺不再保留企业客户数据,公布面向前沿模型的Zero Data Retention及测试中的Private Safety Processing:客户请求处理后不保留提示与响应,数据默认不用于训练,密钥可客户控制,意在从Anthropic手中争夺企业客户,降低企业 AI 审计风险。
𝕏 斯坦福团队用验证框架让 DeepSeek V4 Flash 反超 Fable 5
斯坦福团队为DeepSeek V4 Flash加开源验证框架后,在Terminal-Bench 2.1反超Fable 5;验证成本提高约 8 倍,但总成本仅为 Fable 5 的 1/11。
𝕏 Qwen3.8-27B 发布:更小更聪明,Unsloth 助力优化
阿里 Qwen与Unsloth合作推出Qwen3.8-27B,主打更小体积和更强性能,为开源社区提供更高效的本地部署选择。
𝕏 superwhisper 发布设备端开源模型 S1-mini
superwhisper发布首个开源模型S1-mini,参数量6 亿,可在设备端本地处理转录文本,即日起在 App 中可用。
𝕏 DeepSeek-V4-Pro 在 Agent Arena 升至开源模型第二
DeepSeek-V4-Pro在 Agent Arena 开源模型排名升至第二、整体第 14,每任务中位成本仅**$0.21**,Bash 恢复能力开源第一,重塑开源模型性价比格局。
𝕏 OpenAI 为学生推出 ChatGPT for Teens
OpenAI发布ChatGPT for Teens,面向青少年提供更强的内置安全保护,独立聊天体验。
𝕏 智谱唐杰撰文揭示 GLM-5.3 强化后训练路径
智谱 AI唐杰发文分析 Scaling Law,透露GLM-5.3在相同架构下经一个月长程 RL 后训练,性能显著提升,强调推理能力取决于有效深度而非总参数。
𝕏 OpenAI CFO 称 2027 年上市,Q2 收入 67 亿美元
OpenAI CFO 全员会表示公司将在2027 年IPO,Q2 收入67 亿美元,估值 8520 亿美元,但同期Anthropic Q2 收入达 115 亿美元。此前 CRO、COO、产品负责人接连离职。
𝕏 OpenAI Codex SDK 落地企业:思科构建 App Builder,税务系统处理 7000 份申报
Codex SDK已用于思科 Cloud Control 的 App Builder,用户可用自然语言创建应用。与 Thrive Holdings 合作税务系统处理了7000 份申报,时间缩短约1/3。
𝕏 GLM-5.3 正在测试:Agent 能力新评测打 ToME4
开发者 karminski3 透露,GLM-5.3正在测试新 Agent 能力,让模型玩ToME4比拼分数。测评中 deepseek-v4-pro 出现追击 BOSS 半张地图后将其击杀的有趣表现。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。