天眼早报
🤖 AI 大模型
𝕏 DeepSeek 发布 Harness v0.1:MIT 协议全插件化 Agent 框架
DeepSeek发布Harness v0.1开发者预览版,基于Cordis元框架,模型、工具、会话、沙箱等全部实现为插件,支持热插拔和依赖自愈,采用MIT协议开源。该框架采用命令式插件模型,与 Codex 声明式架构形成对比;可让 Agent 检查自身运行时、编写插件并即时挂载,新能力立即生效,目前插件仅存内存,被视为“自进化软件”原型。
𝕏 Google 发布 Gemini 3.7 Flash:价格减半,编码与 Agent 能力显著增强
Google 发布Gemini 3.7 Flash,主打编码与 Agent 工作流:DeepSWE得分 65.3%,Terminal-bench 得分从 5.4%升至 14.9%,指令遵循与多步规划显著提升;API 价格降至输入**$0.75**、输出**$3.75**每百万 token,为 3.6 Flash 半价。模型已登陆 AI Studio、Antigravity 和 Gemini API,Antigravity 演示其通过 MCP 服务器和多模态理解自主优化网站至 Lighthouse 满分,OpenCode Zen 同步支持;旗舰 Gemini 3.5 Pro 仍延期。
𝕏 DeepSeek V4 Pro 开放权重发布,采用 MIT 许可证
DeepSeek V4 Pro以MIT 许可证开放权重,训练量远超预览版;SGLang已完成对 DeepSeek-V4-Pro-0813 的适配。但随后 HuggingFace 上移除了 V4-Pro-0813 权重,疑似因社区反馈;API 价格方面,Pro 版涨价明显,输出最高27 元/M。
𝕏 45M 参数模型 Needle 2 发布,14MB 即可运行智能体
Cactus发布Needle 2,仅45M 参数、14MB二进制,可在28MB 内存中运行完整智能体会话,工具调用能力匹敌 270M 级模型。
𝕏 Mixedbread 发布搜索代理 Toast 1,性能追平顶尖模型成本降 90%
Mixedbread AI推出Toast 1搜索代理,质量可比肩GPT-5.6 Sol和Opus 5,速度快 12 倍、价格仅 1/10。
𝕏 Grok 4.6 多基准登顶,上线 Perplexity 与 LMArena
Grok 4.6以95%登顶GPQA Diamond,在儿童罕见病诊断基准 RareBench 上超越 Claude Opus 5,成本约其 1/3;上线 Perplexity,WANDR 基准与 Fable 5 持平,成本低 60%以上;同时以 xhigh 版本登陆 LMArena,成为 xAI 最强模型。WebDev 竞技场获 1630 分排名第 5。实测速度快、代码解释清晰,但可能过度字面执行指令。
𝕏 MiniMax 开源 Music3 音乐生成模型
MiniMax开源Music3音乐生成模型,采用8B LLM + 2.7B DiT架构,可根据歌词生成完整歌曲,支持消费级 GPU,已在Hugging Face上线;同时获得 SGLang Day 0 支持,由 Qwen3+RVQ 自回归主干和流匹配解码头组成,可生成配乐。
𝕏 OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 速度达 750 tokens/s
OpenAI联合Cerebras推出 Ultrafast 模式,GPT-5.6 Sol速度达750 tokens/s。
𝕏 Red Hat DSpark 使 Kimi-K3 解码速度提升约 4 倍
Red Hat发布DSpark推测解码器,将Kimi-K3单流交互解码从 110 提升至435 tok/s,吞吐量提升3.5 倍。
𝕏 MiniMax-H3 登顶视频编辑 Arena,成为 SOTA
MiniMax-H3在Video Edit Arena以1390 分登顶,领先第二名 32 分,成为视频编辑 SOTA。
𝕏 AMD 与 PyTorch 联合优化 FP8 训练
AMD为PyTorch上游提交FP8优化,融合 Triton 核,加速 GEMM 和注意力,FP8 训练在Instinct GPU开箱即用。
𝕏 Qwen3.8-2.4T-A95B 开源 MoE 模型上线 HuggingFace
Qwen3.8-2.4T-A95B开源 MoE 模型已上线HuggingFace,拥有2.4 万亿参数。
𝕏 Voyage AI 发布代码检索嵌入模型 Voyage Code 4
Voyage Code 4登陆OpenRouter,支持256 至 2048维度的 Matryoshka 嵌入及多重量化选项。
𝕏 OpenAI 报告:顶尖企业 AI 采用深度是普通企业数倍
OpenAI数据显示,top 10%企业使用插件和技能的频率分别是普通企业的2 倍和6 倍,Agent 工作流正加速扩张。
𝕏 ReactBench 开源基准发布,Grok 4.6 排名第二
ReactBench是开源前端编码基准,测试 React 修复能力,Grok 4.6排名第 2。
𝕏 FLUX 3 Video 在图像转视频 Arena 排名第 5
FLUX 3 Video在 Image-to-Video Arena 获1453 分,排名第 5。
𝕏 Vals AI 推出 RSI 指数评估模型科研能力
Vals AI发布RSI Index,衡量模型在压缩、LLM 训练、参数优化等方向的研发能力。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。