天眼晚报
🤖 AI 大模型
腾讯发布 Hy4 Preview:770B MoE 模型开源,支持百万上下文与自主优化
腾讯正式发布 Hy4 preview 大模型,采用 770B 总参数量的 MoE 架构,激活参数仅 49B,上下文窗口突破 100 万。该模型在 Code Arena WebDev 榜单排名 第 5,Terminal-Bench 和 BrowseComp 两项全球第一。其核心亮点在于首次参与自身训练过程,实现递归自我改进闭环。模型已开源权重并集成至 WorkBuddy_AI 免费使用两周,定价为输入 6 元/百万 tokens,输出 18 元/百万 tokens,专为代码、文档分析及科研设计。
𝕏 Google 发布 Gemini Omni 1.1 Flash:支持 AI 视频对话编辑与 4K 输出
Google 正式发布 Gemini Omni 1.1 Flash 视频模型,新增对话式视频修改与编辑功能,最高支持 4K 分辨率输出。该模型可理解用户自然语言指令直接调整视频内容,标志着多模态生成进入交互新阶段。同时更新包含 Flow 功能,每月提供 100 个 10 秒 视频生成额度,并发布官方提示词手册指导创作。
𝕏 SpaceX AI 团队发布 Grok Bot 六项核心构件指南:从 JD 到自动化交接
SpaceX AI 团队公开 Grok Bot 官方使用指南,提炼出 Job description、Connections、云端专属电脑等六大核心构件。其中工程类案例显示,通过六个 Bot 协作可将游戏 CPI 从 $15 降至 $1,留存提升 4 倍,展示了 AI 智能体在复杂工作流中的高效协作能力。
𝕏 Anthropic 启动 Model Hardware Standard:AI 智能体可操作物理设备
Anthropic 推出 MHS (Model Hardware Standard) 新标准,使 AI Agent 能像操作软件一样控制显微镜、机械臂等实验室和工厂设备。该标准统一了设备接口语言,将集成时间从数月压缩至数小时,并支持自主实验编排与错误恢复。这是 AI 从数字世界迈向实体操作的关键一步,允许 AI 智能体 安全操作科学和制造领域的 物理设备。
阿里 Qwen3.8-Flash 上线 OpenCode Go:125B/6B 架构,支持多模态与 1M 上下文
阿里云 推出 Qwen3.8-Flash 模型,采用 125B/6B 稀疏架构,支持 1M 上下文 窗口及多模态能力。配合千问办公标准模式,单任务生成速度提升约 100%,Token 消耗平均减少 75%,覆盖 95% 日常办公任务。现已集成至 OpenCode Go 平台,为开发者提供高效编码辅助。
𝕏 Nvidia 同意以 129 亿美元收购 Hugging Face
Nvidia 正式宣布以 129 亿美元 现金收购开源模型平台 Hugging Face。此次收购将整合 Nvidia 的算力基础设施与 Hugging Face 的开源生态,加速 AI Agent 在工业级场景的落地,是 AI 领域里程碑式的并购事件。
𝕏 GLM-5.3 Flash 登顶 OpenRouter,AA 得分 57
Z.ai 创始人 jietang 揭晓 GLM-5.3 Flash 为 Ox Alpha 身份,该模型由国产芯片驱动,AA 得分 57,价格为前沿模型的 1/100,在 OpenRouter 周 Token 份额接近 20% 并排名第一,展现了极高的性价比与性能表现。
𝕏 Anthropic 赢得法院诉讼,特朗普政府禁令被撤销
美国法官裁定特朗普政府对 Anthropic 的供应链风险标签非法,要求其立即解除对联邦机构使用 Claude 技术的禁令。判决指出此举构成第一修正案报复及程序违规,标志着 Anthropic 在法律层面取得重大胜利。
𝕏 NVIDIA Vera 芯片正式量产,专为 AI Agent 设计
NVIDIA 确认 Vera 芯片已大规模出货,首批服务器交付 AWS。该芯片搭载 88 个定制 Olympus 核心,内存带宽达 1.2TB/s,在代理工作负载上性能比 x86 CPU 快 1.8 倍,专为下一代 AI Agent 应用打造。
𝕏 Cohere 发布专用文档解析模型 Parse 5,超越传统 OCR
Cohere 推出 Parse 5,一款专为 PDF、PPT、图片 设计的视觉语言模型。该模型采用端到端架构,一次性输出结构化 Markdown 数据,在 ParseBench 测试中得分 79.2,超越 Mistral OCR 4 和 Azure Document Intelligence。支持多语言及复杂表格渲染,大幅提升文档处理效率。
𝕏 Agnes AI 发布 Agnes 2.5 Pro Beta,智能指数跃升至 49
Agnes AI 推出 Agnes 2.5 Pro Beta,在 Artificial Analysis Intelligence Index 评分达 49 分,较 Alpha 版提升 9 分。其 Agent 能力 显著增强,τ³-Banking 任务得分从 12% 升至 36%,接近 Gemini 3.5 Flash 水平,展现出强大的垂直领域处理能力。
DuckDB v2.0 预览版发布:迈向分布式架构与原生 C/S 模式
DuckDB Labs 发布 v2.0 预览版,引入 quack 协议 实现原生客户端/服务器模式,支持远程挂载数据库。新版本还稳定了插件生态系统,提供版本化 C API 和 Rust 绑定,正式版本计划于秋季发布,标志着数据库架构的重大演进。
𝕏 Wan 3.0 登顶视频编辑竞技场榜首,超越 Dreamina 与 MiniMax
Alibaba_Wan 发布的 Wan 3.0 在 Video Edit Arena 中排名第一,得分 1414 ps,领先第二名 Dreamina-seedance-2.5 4 分,领先 MiniMax-H3 22 分。这是该模型首次参与评测即夺冠,确立了其在视频编辑领域的领先地位。
𝕏 Salesforce 推出 Claudeforce,将 CRM 全面迁移至 Claude
Salesforce 宣布与 Anthropic 深化合作,推出 Claudeforce 项目,将核心 CRM 工作流内置于 Claude 模型中。该方案提供 37 个 预置销售技能,通过 Headless 360 架构替代传统界面,预计可将销售优先处理流程从 1 万步点击 缩短至 30 秒,极大提升业务效率。
𝕏 PhoneLLM 开源:专为语音 Agent 设计的低延迟模型
PhoneLLM 基于 NVIDIA Nemotron Nano 30B 微调,专为语音 Agent 设计。在典型任务上达到 GPT-5.6 Terra 性能,但延迟降低至 1/3,成本仅为 1/18。单台 B200 可服务超 80 个 并发 Agent,端到端延迟低于 600ms,单次调用成本约 0.0025 美元,极具商业价值。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。