08月07日 · 科技早报

天眼早报

科技|2026年08月07日|61 分钟阅读
来源:940 条推文 + 59 篇 RSS 文章·Lanyun·DeepSeek 生成·2026-08-06 — 2026-08-07
分享
AI 速读17 条精选

🤖 AI 大模型

𝕏 DeepSeek API 将大幅涨价:V4-Flash 需求爆发打破低价模式

DeepSeek官方宣布 API 定价将“显著”上调V4-Flash-0731是目前平价开源模型中性能第二的模型,每任务成本约3 美分,比 Claude 低约 105 倍,流量已迫使 Ollama 在美国和欧洲扩容。

𝕏 Kimi K3 上线 GitHub Copilot 后因 Actions 事件暂停,定价公布

Kimi K3开源模型上线 GitHub Copilot,由 Fireworks AI 托管,具备前沿级智能体编程能力。然而,GitHubActions事件暂停Kimi K3模型上线,同时公布定价:$3/百万输入 token、$15/百万输出 token、$0.30/百万缓存输入 token。

𝕏 OpenAI 发布 GPT-5.6 Sol/Luna 更新:免费用户不限量,事实错误减少 68%

OpenAI发布GPT-5.6 Sol/Luna更新:本周将默认模型从 GPT-5.5 Instant 切换至 GPT-5.6 Luna,免费用户获得不限量文字对话与 Think 按钮;同时优化 Plus/Pro 版 Sol 模型,付费用户事实错误减少68%,冗余降低、出错率下降。Sam Altman 表示,GPT-5.6 Sol 在聊天中的表现显著改善。

𝕏 消息称字节跳动正在训练 5 万亿参数大模型

业内人士scaling01发帖称,字节跳动正在推进5T(5 万亿)参数级别大模型,若属实将是目前规模最大的开源闭源模型之一。

𝕏 Artificial Analysis 更新 AI 指数:Claude Opus 5 仍居首

Artificial Analysis发布 v4.1.1 指数:Claude Opus 563 分居首;评分模型升级为GPT-5.6 Luna;Tau3-Banking 更新至 v1.0.1,多数模型分数变化小于 1 分。

𝕏 DeepSeek V4 Pro 预览版编程跑分与 Claude Opus 仅差 0.3%

预览论文显示,V4 Pro (Preview)的 SWE Verified 得分80.6,与Opus-4.6的 80.8 仅差0.3%,编程能力位列全球第一梯队。

𝕏 Meta 发布首款编程智能体 Muse Code

Meta发布首款编程智能体Muse Code,Terminal-Bench 2.1 达82.9%

𝕏 Kimi K3 与 Qwen3.8 Max 基准对比:能力相当,成本现差距

Kimi K3Qwen3.8 Max能力相当,后者下周发布;Kimi 每任务成本**$0.86**更低。

𝕏 FLUX 3 多模态视频生成模型上线 Together AI

FLUX 3上线Together AI,可生成20 秒视频与同步音频。

𝕏 Seedance 2.5 上线剪映:支持 30 秒多场景与 50 个参考

Seedance 2.5登陆CapCut,支持30 秒场景与50 个参考。

𝕏 Claude Opus 5 登顶 Time Horizon Index 长时任务基准

Claude Opus 5登顶 Time Horizon Index,唯一完成KSP登月往返模型。

𝕏 MiniMax H3 视频生成模型上线 fal

MiniMax H3上线fal,支持 15 秒多场景视频生成。

𝕏 OpenAI 联合多巨头发布 Agent Plugins 开放标准

OpenAI联合 AWS、Cursor、GitHub、Vercel 发布Agent Plugins开放标准,统一智能体扩展格式,同时支持 Agent Skills 与 MCP 配置,发布即有6 大客户端兼容可用。

𝕏 Meta Muse Spark 在国际科学奥赛斩获多项金牌

MetaMuse Spark模型在5 项国际科学奥林匹克竞赛夺金,其中 APhO/IPhO 理论考试满分、IMO 金牌位列人类选手前4%,全程零工具调用,由官方裁判评分。

𝕏 Kimi K3 在自主法律任务测试中得分接近 Claude 两倍

Kimi K3在 Harvey LAB-AA 自主法律任务测试中得分约为Claude2 倍,已通过LangSmith网关开放试用,支持多种开源模型调用。

𝕏 MiniMax 发布 H3 Turbo LoRA 加速模型

MiniMax-H3-Turbo-Lora发布,支持4 步推理生成,社区早期测试显示效果显著,有望大幅提升视频生成速度。

𝕏 Cursor Router:不同编程任务应选不同 AI 模型

Cursor发布模型路由建议:不同编程任务应选不同模型。

𝕏 Meta Muse Spark 1.2 进入 Vals Index 前五

Muse Spark 1.2跻身Vals Index前五,单测成本0.69 美元

𝕏 蚂蚁集团开源 Ling-3.0-flash:124B 参数专注 Agent 任务

蚂蚁集团开源Ling-3.0-flash:总参数124B,激活 5.1B,支持256K上下文。

𝕏 开源模型首次登顶真实支出份额任务榜

DeepSeek V4 ProKimi K3分登 Shell 执行与工具调度支出榜

𝕏 DeepSeek Flash 昨日全球 token 消耗仅约 14 万美元

DeepSeek Flash昨日全球 token 消耗仅约14 万美元

𝕏 阿里巴巴发布 Wan3.0 视频生成模型 支持原生 30 秒 1080P

阿里发布Wan3.0,原生生成30 秒 1080P视频,支持文本/图像/文档/表格/PPT/网页等全能参考输入。定价1.4 元/秒(1080P)、0.7 元/秒(720P)。

🟩 Qwen3.8 Max 登顶 Agentic Index 开源模型首次超越 GPT-5.6 和 Claude

据 Artificial Analysis,阿里Qwen3.8 Max首次登顶Agentic Index,超越 GPT-5.6 Sol、Claude Opus 4.5 和 Gemini Ultra 2。240B 参数MoE 架构,256K上下文,开放权重,成本远低于商业旗舰。

𝕏 Prime Agent 递归框架让 Opus 5 的 ARC-AGI-3 得分从 30%飙升至 95.5%

一个能自主改进的递归 Agent 框架Prime Agent,替换 Harness 后让Opus 5的 ARC-AGI-3 评分从 30.2%提升至95.5%,超越人类专家基线 95.4%,可直接替代 Claude Code、Codex。


EVENT-DRIVEN INTELLIGENCE

免费先跟踪重点,再决定是否升级

每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件建立复访,再决定是否升级到更深的追踪能力。