天眼早报
🤖 AI 大模型
𝕏 月之暗面发布 Kimi K3 2.8 万亿参数模型,支持 vLLM、AMD 及本地运行
月之暗面发布Kimi K3模型,拥有2.8 万亿参数、100 万token 上下文。vLLM提供推理引擎,支持 NVIDIA Grace Blackwell、Hopper 等平台,并与 Baseten 等云服务集成。同时,vLLM 宣布Kimi K3从首日起支持AMD Instinct硬件。此外,Unsloth将 Kimi K3 1-bit 量化至594GB,体积减少 62%,保留78.9%准确率,可在Mac Studio + 128GB 运行。模型采用 MoE 架构(每 token 激活 16/896 专家),使用 Kimi Delta Attention 混合注意力机制。
𝕏 Google DeepMind 发布 Lyria 3.5 音乐模型及 Flow Music 平台
Google DeepMind发布Lyria 3.5,现驱动Flow Music。新功能包括更富表现力的歌声、自然的编曲、BPM 控制、可导出分轨。同时支持改进旋律、歌词质量和情感歌声,可修改段落、翻译歌词。音乐创作能力显著提升。
𝕏 英伟达提出 NOOA:将 AI 智能体构建为 Python 对象
英伟达提出NOOA框架,核心概念是将智能体构建为Python 对象,方法即行动,字段即状态,文档字符串即提示。该方法将概率性与确定性行为统一在源码中,在 SWE-bench、Terminal-Bench 2.0、ARC-AGI-3 上进行了评估。
𝕏 OpenAI 为 10 万名科学家免费提供前沿模型
OpenAI宣布ChatGPT for Academic Researchers计划,从10,000名研究者开始,2027 年前扩至100,000人。免费提供GPT-5.6 Sol Pro、ChatGPT Work、Codex 及 75+生命科学技能,数据不用于训练。这是其2.5 亿美元科研承诺的一部分。
𝕏 SpaceXAI 发布 Grok Voice Think Fast 2.0,语音对话能力大幅提升
SpaceXAI发布Grok Voice Think Fast 2.0,语音到语音模型在索引评分达82.9%,时延仅0.70 秒,排名第二。定价每小时4.80 美元,较前代提价 60%。在代理任务 Tau Voice 上以**56.5%**取得第一名。
𝕏 Claude Opus 5 在 Agent Arena 排名第二
Claude Opus 5 (Max) 在 Agent Arena 排名第二,净改善11.88%,在确认成功和好评信号上排名第一。
OpenAI 总裁回应苹果诉讼:对他国商业机密无兴趣,硬件新品将很快问世
OpenAI总裁 Greg Brockman 回应苹果诉讼,否认窃取机密,并透露与 Jony Ive 合作的硬件新品“很快”问世。
🔶 翁荔重返 OpenAI
翁荔退出 Thinking Machines 后重返OpenAI,将从事 AI 模型递归自我改进方向研究。
𝕏 Sam Altman 最新访谈:GPT-4 促使下决心囤算力,机器人 ChatGPT 时刻两三年内出现
Sam Altman透露,GPT-4 让 OpenAI 下决心囤算力;ChatGPT 源于 Playground 聊天功能;AI 文案写作是首个跑通场景。
𝕏 Grok 4.5 在 LaurenBench 排名第一
Grok 4.5 在 LaurenBench 上以 56.9% 得分排名第一,超越 Claude Sonnet 5、GLM 5.2、Claude Opus 5、Kimi K3 和 GPT-5.6。该基准测试考察 AI agent 在对话、工具使用、记忆和安全方面的真实表现。
𝕏 SWE-rebench 大更新:Opus 5 和 Fable 5 领跑,Grok 4.5 速度最快
SWE-rebench 发布 7 月更新,新增111个任务,覆盖5种语言。Opus 5 [high] 以52.3% Pass all 5 领先稳定性,Fable 5 [high] 以64.5% Pass@1 夺冠。Grok 4.5 [high] 以63.8% Pass@1 排名第二,执行速度最快(中位数8.9分钟)。GPT-5.6 Sol [medium] 效率最高,每任务仅18.4次动作和0.6M tokens。
𝕏 Memento:LLM agent 的持续学习框架,无需微调模型权重
开源框架 Memento 基于记忆实现 LLM agent 持续学习,无需更新模型权重。维护历史轨迹案例库,新任务时检索相似案例规划行动。采用 Planner-Executor 架构,支持搜索、代码执行、文档处理等工具。
𝕏 lmsys 发布 Blackwell 原生低精度 RL 食谱:MXFP8 和 NVFP4
lmsys在 Miles 中开源了两个 Blackwell 原生低精度强化学习方案:端到端MXFP8和硬件原生NVFP4 W4A4(适用于 MoE 模型)。在 Qwen3-30B-A3B 上,5 种低精度配置均紧跟 BF16 奖励曲线,同时减少推理时间。
𝕏 Kimi Code 在 agent 任务中 token 效率远超 Claude Code,成本低至 1/9
Composio 测试显示,Kimi Code 在 agent 任务中平均每任务仅使用61k tokens,而Claude Code 需340k tokens。按 K3 输入费率计算,平均每任务成本:Kimi Code $0.22,Claude Code $2.00。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。