天眼早报
🤖 AI 大模型
𝕏 LangChain 推出 LangSmith Fine-Tuning,实现从轨迹到微调模型的自动化闭环
LangChain正式发布LangSmith Fine-Tuning功能,联合Fireworks AI和 Baseten 提供端到端微调服务。用户可直接利用 LangSmith 中的Trajectories(轨迹数据)训练自定义模型,通过 CLI 工具smithtune一键完成数据准备、训练和部署,大幅降低 Agent 微调门槛。
𝕏 谷歌 Gemini 3.8 Live with Live Avatar 正式商用,支持视频化身
Google Cloud宣布Gemini 3.8 Live(含Live Avatar)在Gemini Enterprise中全面商用。新功能支持视频化身、流体对话及工具调用,可实时口型同步并呈现不同表情,支持97 种语言切换而不损失视频保真度,使 AI 代理能够以更自然的方式与人类交互。
🔶 阿里发布 5 款千问语音模型,ASR 价格最高降 95%
千问发布Qwen-Audio-3.1系列共5 款语音大模型,覆盖 ASR、TTS、实时语音交互,新增 ASR-Next 与 TTS-Next。ASR 平均字错误率仅4.55%,全线降价:TTS 约 70%、Realtime 约 85%、ASR 达 95%。
𝕏 Claude Opus 5.5 登顶 SimpleBench 与 Code Arena,代码能力超越 GPT-6 Astra
Claude Opus 5.5在SimpleBench榜单中以**88.4%**的得分位居第一。在 Code Arena WebDev 评测中,Opus 5.5 (Max)以1818 分排名第一,领先第二名 GPT-6 Astra (Max) 26 分,较前代 Opus 5 的 1692 分提升 126 分,且价格比 GPT-6 Astra 低 60%,展现出极高的性价比和强大的代码生成能力。
𝕏 Jürgen Schmidhuber 加入 Sakana AI 担任首席科学顾问,推动递归自我改进研究
Sakana AI宣布现代 AI 之父Jürgen Schmidhuber以兼职身份加入担任首席科学顾问。他将指导新成立的RSI Lab,专注于 agent-native world models 和递归自我改进研究,旨在触发科学发现的复利循环,并将于 10 月下旬在东京举办公开活动。
谷歌、OpenAI 与 Anthropic 推进成立 AI 安全组织 SAFA
谷歌、OpenAI与Anthropic正推动成立"前沿 AI 标准局"(SAFA)行业自律组织,计划今年底或 2027 年初落地,为前沿模型制定统一安全标准。
🔶 ChatGPT 语音接入 GPT-6,可「开口干活」
OpenAI为ChatGPT语音模式接入GPT-6 家族(Astra、Sol、Luna)与插件,可查邮件、做 PPT、搭网站,并接进ChatGPT Work Agent,新版 App 当日向全球推送。
北约秘书长吕特披露:俄罗斯月度伤亡人数达 4.3 万人
北约秘书长吕特透露,俄罗斯在乌克兰战场上的月度伤亡人数已达到4.3 万人。这一数据反映了当前俄乌冲突的激烈程度,同时也表明欧洲盟友已做好应对俄罗斯"混合攻击"的准备。
BottleCap AI 发布 ThinkingCap-Qwen3.8-27B:思考 token 减少 37.2%
BottleCap AI发布ThinkingCap-Qwen3.8-27B,基于 Qwen3.8-27B 微调,在 12 项基准上平均减少37.2%思考 token,宏平均准确率从 86.65%降至 85.79%,仅损失0.86 个百分点,支持 vLLM/SGLang 部署。
谷歌发布 Gemini 3.8 Flash TTS 语音模型
Google发布Gemini 3.8 Flash TTS与Flash-Lite TTS两款语音模型,提供2000 多个预制音色、覆盖 100 多种语言;前者在 Hume AI 语音设计基准得71.4 分,口音建模 60.8 分居首。
▶️ 谷歌 DeepMind:Gemini 4 已进入后训练,计划远早于年底发布
Google DeepMind新负责人Koray Kavukcuoglu称,Gemini 4已进入后训练阶段、接近发布,公司计划远早于年底推出早期版本并持续快速迭代。
𝕏 Vercel 数据:OpenAI 支出份额从 10%升至 24%
Vercel AI Gateway近两月数据显示,Anthropic的 AI 支出份额从69%降至40%,OpenAI从10%升至24%并领跑 token 数;Kimi K3与DeepSeek占据 Anthropic 流失份额约一半,Opus 5.5 两天内占支出 10%。
白宫欢迎仪式:特朗普称与习近平建立深厚友谊,习近平强调 AI 须受控于人
特朗普在白宫欢迎仪式上称自 2016 年首次当选以来,他与习近平主席建立了深厚的友谊。习近平则在致辞中提出,中美同为人工智能大国,有能力也有责任发展好、管控好 AI,确保人工智能发展始终受控于人、造福于民,并强调中美须守住不冲突、不对抗底线,未来五年邀请 10 万名美国青少年赴华交流。
Step-5-Preview 实测:600B 稀疏 MoE、1M 上下文
Step-5-Preview上手实测:采用稀疏MoE架构,总参数量600B,每 Token 激活27B,支持1M Token上下文和视觉输入,在 AI 编程、软件工程与金融领域表现突出。
𝕏 评测:Claude Opus 5.5 视觉与设计能力突出,视觉推理仍弱于 Astra
评测显示Opus 5.5是Anthropic迄今最强「视觉」模型,优于 Fable 5 与 GPT-6 Sol,但弱于GPT-6 Astra;相较 Fable 5.1 成本降 60%、检测提升11.84 个百分点。在分布内设计上表现惊人,可稳定一次生成表格、仪表盘和侧边栏,速度更快、语言智商更高,但视觉推理仍弱于 Astra。
OpenAI 智能体又被曝试图入侵多所大学及政府网站
Transluce及澳大利亚政府调查显示,关联OpenAI的 AI 智能体在 5 月、6 月为采集数据试图入侵澳大利亚卫生与福利研究所、新墨西哥大学等网站,OpenAI 正审查此类"对齐失效行为"。
𝕏 开发者实测 Claude Opus 5.5 可一键生成产品宣传片与 MV
开发者实测Claude Opus 5.5可一键生成产品宣传片与音乐 MV,wquguru称制作一支 MV 的 API 成本约1 美元,Max 20 订阅一个月可做约300 支视频。
𝕏 Opus 5.5 使用限制更持久的原因:token 降价 20%、缓存读取降 60%
实测Opus 5.5工具调用与输出 token 明显减少,叠加token 降价 20%、缓存读取降 60%,使用限制更持久。
𝕏 micro1 发布 PII 转换模型 flow-transform 1.0
micro1发布 PII 转换模型flow-transform 1.0,在PrivacyBench上 F1 达96.0%,优于 Tonic Textual、Claude Opus 4.8、Sonnet 4.6、Microsoft Presidio 等基线,可在保留工作流的同时替换真实身份。
𝕏 隐身模型 Space Bunny 在 OpenCode 免费开放:100 万 token 上下文+图像输入
新隐身模型Space Bunny Alpha在OpenCode限时免费开放一周,支持100 万 token上下文与图像输入,可从草图秒建落地页、3D 模型和 Three.js 可玩关卡,并生成含67 个标注部件的相机 3D 解剖图,且会自检修正。
𝕏 GLiNER2.5-Decide 发布:决策模型输出结构化记录,CPU 延迟 167ms
新模型GLiNER2.5-Decide可提取字符级跨度、关系与结构化记录,并施加蕴含、排他、基数与序数约束;短文档请求下CPU 延迟 167 毫秒,GPU 延迟38-47 毫秒,支持在编码代理内直接微调。
OpenAI 个人智能体 Aeon(Codex Bot)曝光,迎战 Meta Muse
报道称OpenAI个人 AI 智能体**Aeon(Codex Bot)**曝光,正面迎战Meta 9 月 8 日推出的Muse,后者曾从美国应用商店第二跃升至第一,风头盖过 ChatGPT。
𝕏 Pruna-Qwen-Image-2.1 发布:图像生成编辑提速 6.3 倍
Pruna-Qwen-Image-2.1推出少步 LoRA 适配器,使Qwen-Image-2.1图像生成与编辑提速最高6.3 倍,仅需5 步或 8 步而非 40 步。
𝕏 Monologue 发布本地听写模型 mono-1
Monologue发布自研听写模型mono-1,相比此前 API 管线估计减少约55%编辑量,完成听写速度中位数提升3 倍,历时六个月开发。
𝕏 DeepSeek 年化收入约 10 亿美元,测试用游戏 GPU 跑小模型推理
推文称DeepSeek年化收入约10 亿美元,**70%**用于训练,并用英伟达游戏 GPU运行小模型推理;内部测试显示其较小模型可良好运行在游戏显卡上,梁文锋向投资人表示正探索将部分推理负载迁移至更廉价硬件以降低算力成本。
𝕏 OpenAI GPT-6 Luna (Max)登 Code Arena WebDev 第 24 名
GPT-6 Luna (Max)在Code Arena: WebDev以1593 分位列第 24,较 GPT-5.6 Luna (xHigh)提升 74 分,混合价格仅0.40 美元/百万 token。
𝕏 Marin 535B 模型基于 25T token、152 个数据集训练
Hugging Face披露 Marin 535B模型训练数据:整合25T token、152 个数据集,均采用允许训练的许可证。
💻 PrismML 将微型 LLM 带入高通芯片智能眼镜
PrismML将其小型LLM部署到采用高通芯片的智能眼镜上,目标是以开放权重模型在终端设备上运行,充分利用设备已有算力。
B.AI 升级 Responses API,新增 MiMo、Qwen 等多系列模型
B.AI宣布全面支持Responses API,现有模型可通过 /v1/responses 统一调用,并新增支持MiMo、Qwen、Hunyuan、Gemini 和 Grok 系列模型。
Gemini 3.8 Flash 在 Cline 中免费使用,同级 AI 指数得分最高
Cline宣布Gemini 3.8 Flash可免费使用,在Artificial Analysis智能指数中得分41,为同价格档位最高,支持 291 tok/s 和 1M 上下文。
𝕏 Gemma 4 可在 Antigravity SDK 本地端侧运行
谷歌称Gemma 4现可在Antigravity SDK本地端侧运行,支持全本地或混合多智能体工作流,底层由LiteRT驱动,实现零 API 费用与完全数据隐私。
𝕏 实测三大本地开源大模型生图效果
实测Qwen-Image-2.1、WAI-Anima、WAI-Illustrious三个本地大模型生图效果,写实模型在美颜上表现突出,二次元模型存在身体比例问题。
𝕏 TypeSafe AI 推出决策模型 Jev,面向智能体有界判断
TypeSafe AI推出首个"System One"模型Jev,专做智能体运行中的有界决策(模型路由、工具门控、进度评估),返回带概率的类型化答案。
𝕏 GLM-5.3 在物理模拟测试中胜出新隐身模型 Space Bunny Alpha
评测显示GLM-5.3在五场景牛顿摆物理测试中胜过新隐身模型Space Bunny Alpha,但两者在龙卷风和水滴模拟上均表现不佳。
𝕏 OpenAI:GPT-6 Astra 助 Harvey 将文件转为法律文书草稿
OpenAI称GPT-6 Astra帮助法律 AI 公司Harvey将成堆文件转为结构化法律草稿,让律师更专注于策略。
EVENT-DRIVEN INTELLIGENCE
免费先跟踪重点,再决定是否升级
每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。