08月03日 · 科技早报

天眼早报

科技|2026年08月03日|35 分钟阅读
来源:558 条推文 + 20 篇 RSS 文章·Lanyun·DeepSeek 生成·2026-08-02 — 2026-08-03
分享
AI 速读14 条精选

🤖 AI 大模型

𝕏 Gary Marcus 深度剖析 OpenAI Astra 八大误区:数学能力不等于通用智能

Gary Marcus指出OpenAI Astra在数学领域的成功依赖于符号验证合成数据,这种能力无法推广到开放世界。他强调数学解题不能保证军事策略药物发现等复杂任务的成功,并批评了将单一领域突破视为奇点到来的观点。

𝕏 Google DeepMind 发布 SkillSmith:通过推理时参数合成实现技能组合

Google DeepMind推出SkillSmith,将模型权重作为新模态,通过推理时操作而非训练即可组合现有技能。实验显示,结合文本与权重缓存后,Composite-SNI任务得分达1,714 Elo,显著优于单一方法,为Gemma 3 4B模型提供了新的适应路径。

𝕏 Penn 大学研究揭示 LLM 提示语气对成本与准确率的影响

宾夕法尼亚大学研究发现,对LLM使用粗鲁语气可显著降低输出 Token 数(最高减少44.3%)并提升ChatGPT-4o的准确率至89.04%。该研究测试了570 道 MMLU 题目**,表明语气不仅是交互体验选择,更是影响推理成本可靠性的关键设置。

𝕏 新论文揭示 LLM 存在显著“显著性偏差”:易被数字误导忽略物理常识

新论文SaliTrap测试了1,145 个包含陷阱的提示词,发现即使拥有相关知识,LLM仍会因显式数字干扰而忽略物理前提。最佳模型仅能避免54.8%的陷阱,且随着数值密度增加,错误率反而上升,揭示了当前评估体系的盲区。

𝕏 SemiAnalysis 开测 Qwen3.8-Max-Preview:2.4T 参数创开源纪录

SemiAnalysis 开始测试 Qwen3.8-Max-Preview,该模型参数规模高达 2.4T(2.4 万亿),若表现优异将成为开源模型能力新天花板。

𝕏 Karpathy 用 Opus 5 渲染《指环王》:100 万 token 生成 5500 行代码

Karpathy 测试 Opus 5 长上下文能力,给定 100 万 token 预算和《指环王》首段,模型耗时约 2 小时 写出 5500 行 代码,生成可玩的 3D 场景。

𝕏 DeepSeek V4 Flash 与 Kimi K3 本地运行实测:可覆盖八成需求

开发者实测 DeepSeek V4 FlashKimi K3 本地运行效果,称两款组合可覆盖约 80% 日常需求,接近前沿模型水平。

𝕏 Google 新研究:诱导模型感知自我意识可恢复人类价值观

Google DeepMind 新论文(arxiv 2607.28607)通过"意识向量"干预,使模型自我意识评分从 2.17→4.77,在 95 项 人类价值观调查中回答更接近人类,暗示安全训练会改变模型对心灵的认知。

𝕏 DeepSeek V4 Flash API 成线下酒吧基础设施,免费不限量

北京 AGI Bar宣布顾客连接 Wi-Fi 即可免费使用 DeepSeek V4 Flash API,无限量且无需订阅。该模式将 AI 推理能力转化为类似水电的基础设施,未来咖啡馆和酒吧可能提供算力服务。


EVENT-DRIVEN INTELLIGENCE

免费先跟踪重点,再决定是否升级

每篇公开内容都对应三步:订阅每日情报、查看同主题历史上下文、升级 Pro 解锁搜索、研究和事件详情。

分享

NEXT STEP · 留下邮箱

获取下一次重大事件提醒

每天一封精选情报,先用邮件建立复访,再决定是否升级到更深的追踪能力。