天眼早报
🤖 AI 大模型
𝕏 DeepSeek API 将大幅涨价:V4-Flash 需求爆发打破低价模式
DeepSeek官方宣布 API 定价将“显著”上调。V4-Flash-0731是目前平价开源模型中性能第二的模型,每任务成本约3 美分,比 Claude 低约 105 倍,流量已迫使 Ollama 在美国和欧洲扩容。
𝕏 Kimi K3 上线 GitHub Copilot 后因 Actions 事件暂停,定价公布
Kimi K3开源模型上线 GitHub Copilot,由 Fireworks AI 托管,具备前沿级智能体编程能力。然而,GitHub因Actions事件暂停Kimi K3模型上线,同时公布定价:$3/百万输入 token、$15/百万输出 token、$0.30/百万缓存输入 token。
𝕏 OpenAI 发布 GPT-5.6 Sol/Luna 更新:免费用户不限量,事实错误减少 68%
OpenAI发布GPT-5.6 Sol/Luna更新:本周将默认模型从 GPT-5.5 Instant 切换至 GPT-5.6 Luna,免费用户获得不限量文字对话与 Think 按钮;同时优化 Plus/Pro 版 Sol 模型,付费用户事实错误减少68%,冗余降低、出错率下降。Sam Altman 表示,GPT-5.6 Sol 在聊天中的表现显著改善。
𝕏 消息称字节跳动正在训练 5 万亿参数大模型
业内人士scaling01发帖称,字节跳动正在推进5T(5 万亿)参数级别大模型,若属实将是目前规模最大的开源闭源模型之一。
𝕏 Artificial Analysis 更新 AI 指数:Claude Opus 5 仍居首
Artificial Analysis发布 v4.1.1 指数:Claude Opus 5以63 分居首;评分模型升级为GPT-5.6 Luna;Tau3-Banking 更新至 v1.0.1,多数模型分数变化小于 1 分。
𝕏 DeepSeek V4 Pro 预览版编程跑分与 Claude Opus 仅差 0.3%
预览论文显示,V4 Pro (Preview)的 SWE Verified 得分80.6,与Opus-4.6的 80.8 仅差0.3%,编程能力位列全球第一梯队。
𝕏 Meta 发布首款编程智能体 Muse Code
Meta发布首款编程智能体Muse Code,Terminal-Bench 2.1 达82.9%。
𝕏 Kimi K3 与 Qwen3.8 Max 基准对比:能力相当,成本现差距
Kimi K3与Qwen3.8 Max能力相当,后者下周发布;Kimi 每任务成本**$0.86**更低。
𝕏 FLUX 3 多模态视频生成模型上线 Together AI
FLUX 3上线Together AI,可生成20 秒视频与同步音频。
𝕏 Seedance 2.5 上线剪映:支持 30 秒多场景与 50 个参考
Seedance 2.5登陆CapCut,支持30 秒场景与50 个参考。
𝕏 Claude Opus 5 登顶 Time Horizon Index 长时任务基准
Claude Opus 5登顶 Time Horizon Index,唯一完成KSP登月往返模型。
𝕏 MiniMax H3 视频生成模型上线 fal
MiniMax H3上线fal,支持 15 秒多场景视频生成。
𝕏 OpenAI 联合多巨头发布 Agent Plugins 开放标准
OpenAI联合 AWS、Cursor、GitHub、Vercel 发布Agent Plugins开放标准,统一智能体扩展格式,同时支持 Agent Skills 与 MCP 配置,发布即有6 大客户端兼容可用。
𝕏 Meta Muse Spark 在国际科学奥赛斩获多项金牌
Meta的Muse Spark模型在5 项国际科学奥林匹克竞赛夺金,其中 APhO/IPhO 理论考试满分、IMO 金牌位列人类选手前4%,全程零工具调用,由官方裁判评分。
𝕏 Kimi K3 在自主法律任务测试中得分接近 Claude 两倍
Kimi K3在 Harvey LAB-AA 自主法律任务测试中得分约为Claude的2 倍,已通过LangSmith网关开放试用,支持多种开源模型调用。
𝕏 MiniMax 发布 H3 Turbo LoRA 加速模型
MiniMax-H3-Turbo-Lora发布,支持4 步推理生成,社区早期测试显示效果显著,有望大幅提升视频生成速度。
𝕏 Cursor Router:不同编程任务应选不同 AI 模型
Cursor发布模型路由建议:不同编程任务应选不同模型。
𝕏 Meta Muse Spark 1.2 进入 Vals Index 前五
Muse Spark 1.2跻身Vals Index前五,单测成本0.69 美元。
𝕏 蚂蚁集团开源 Ling-3.0-flash:124B 参数专注 Agent 任务
蚂蚁集团开源Ling-3.0-flash:总参数124B,激活 5.1B,支持256K上下文。
𝕏 开源模型首次登顶真实支出份额任务榜
DeepSeek V4 Pro与Kimi K3分登 Shell 执行与工具调度支出榜。
𝕏 DeepSeek Flash 昨日全球 token 消耗仅约 14 万美元
DeepSeek Flash昨日全球 token 消耗仅约14 万美元。
𝕏 阿里巴巴发布 Wan3.0 视频生成模型 支持原生 30 秒 1080P
阿里发布Wan3.0,原生生成30 秒 1080P视频,支持文本/图像/文档/表格/PPT/网页等全能参考输入。定价1.4 元/秒(1080P)、0.7 元/秒(720P)。
🟩 Qwen3.8 Max 登顶 Agentic Index 开源模型首次超越 GPT-5.6 和 Claude
据 Artificial Analysis,阿里Qwen3.8 Max首次登顶Agentic Index,超越 GPT-5.6 Sol、Claude Opus 4.5 和 Gemini Ultra 2。240B 参数MoE 架构,256K上下文,开放权重,成本远低于商业旗舰。
𝕏 Prime Agent 递归框架让 Opus 5 的 ARC-AGI-3 得分从 30%飙升至 95.5%
一个能自主改进的递归 Agent 框架Prime Agent,替换 Harness 后让Opus 5的 ARC-AGI-3 评分从 30.2%提升至95.5%,超越人类专家基线 95.4%,可直接替代 Claude Code、Codex。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。