AI能耗降低100倍
塔夫茨大学研究人员结合神经网络与符号推理,开发出能将 AI 能耗降低 100 倍的神经符号方法,同时提高机器人任务准确性。
A daily radar for AI · AI4Science · Materials Discovery
Track frontier model releases, scientific ML breakthroughs, materials discovery, benchmarks, and conference deadlines — updated daily.
从今日资讯与论文中提炼出最値得关注的三项进展
印度理工学院团队开发专为材料科学设计的语言模型 LLaMat,在 42 项任务上超越 Claude、GPT 和 Gemini,训练基于约 400 万材料科学论文,揭示"适应刚性"现象。
Anthropic 在商业采用上首次超越 OpenAI,Ramp AI 指数显示其企业采用量同比增长 4 倍,而 OpenAI 仅增长 0.3%,但面临算力瓶颈挑战。
OpenAI 正式将 ChatGPT、编码代理 Codex 和开发者 API 合并为单一产品团队,由 Codex 负责人领导,目标打造集成 Atlas 浏览器的"超级应用"。
由 Claude 搜索汇总,覆盖模型发布、政策动态、行业进展
OpenAI 正式将 ChatGPT、编码代理 Codex 和开发者 API 合并为单一产品团队,由 Codex 负责人领导,目标打造集成 Atlas 浏览器的"超级应用"。
Anthropic 在商业采用上首次超越 OpenAI,Ramp AI 指数显示其企业采用量同比增长 4 倍,而 OpenAI 仅增长 0.3%,但面临算力瓶颈挑战。
xAI 正式解散,于 5 月 6 日并入 SpaceX 成为 SpaceXAI 部门,Elon Musk 称之为垂直整合,但多位联合创始人已离开创立新公司。
美国政府扩大 AI 安全评估计划,Google DeepMind、微软和 xAI 同意在公开发布前提供前沿模型供政府测试网络安全和生物安全漏洞。
英国 AI 安全研究所报告称 Anthropic 最新 Mythos 模型在网络攻击测试中展示"显著能力跃升",可完成完整网络接管,引发副总统 JD Vance 对关键基础设施安全的警告。
OpenAI 发布 GPT-5.5,仅在 GPT-5.4 发布六周后推出,达到 60.24 智能指数分数,并推出 GPT-5.5-Cyber 限量预览版专供关键基础设施防御者使用。
Google Cloud 组建数百人"前置工程师"团队帮助企业客户部署 AI 产品,追随 OpenAI 和 Anthropic 建立 PE 支持的企业合资公司战略。
美国至少 11 个州提出限制性数据中心立法,Sanders 和 Ocasio-Cortez 参议员提出联邦暂停法案,数据中心 NIMBYism 成为 AI 扩展的一阶瓶颈。
中国四家实验室在 12 天内发布开源权重编码模型:智谱 GLM-5.1、MiniMax M2.7、月之暗面 Kimi K2.6 和 DeepSeek V4,成本不到 Claude Opus 4.7 的三分之一。
Google 将于 5 月 19 日 I/O 大会发布新 Gemini 模型,预计重点关注智能体 AI 和 Gemini 能力更新,Android 17 已进入测试阶段。
精选 AI4Science 突破,涵盖材料发现、自动化实验与科学基础模型
塔夫茨大学研究人员结合神经网络与符号推理,开发出能将 AI 能耗降低 100 倍的神经符号方法,同时提高机器人任务准确性。
研究人员展示量子计算与 AI 结合可显著改善复杂混沌系统预测,通过量子计算识别隐藏模式,使 AI 随时间推移更准确和稳定。
新 AI 系统 Synthegy 让化学家通过简单语言描述即可指导合成和反应规划,强大算法生成并优化复杂分子设计路径。
研究人员证明神经形态计算机可求解物理模拟背后的复杂方程,这一能力曾被认为仅限于能耗巨大的超级计算机,为低能耗 AI 计算硬件指明方向。
密歇根大学创建的 AI 系统可在数秒内解读脑部 MRI 扫描,准确识别广泛神经疾病并标记需紧急护理的病例,在训练数十万扫描后显著缩短成像与临床决策时间。
加州理工研究人员通过定时磁场驱动材料,创造出可能更稳定且抗错误的奇异量子态,这是量子计算面临的最大挑战之一。
材料科学 × 机器学习:从催化剂发现到晶体结构预测
印度理工学院团队开发专为材料科学设计的语言模型 LLaMat,在 42 项任务上超越 Claude、GPT 和 Gemini,训练基于约 400 万材料科学论文,揭示"适应刚性"现象。
MIT 研究团队训练生成式 AI 扩散模型 DiffSyn,基于 23,000 多篇论文中的材料合成配方,可为沸石等复杂材料自动生成合成路径,加速材料发现。
提出透明、可扩展的 AI 驱动基础设施框架,整合开源工具统一数据采集、建模和部署,强调自驱动实验室和区块链机制实现实时优化和供应链追溯。
采用自然语言处理技术筛选单原子催化剂,构建二元描述符优化候选,锚定在氮硫原子上的原子分散钴催化剂显著促进钠硫电池硫还原反应,实现高比容量。
综述量子计算和机器学习算法如何推进高熵材料特别是高熵 MXenes 的设计,讨论晶体结构编码解码作为创建高熵材料数据库的关键,应用于电池和超级电容器。
批判性综述 AI 在固态电池电解质和界面工程中的应用进展,涵盖稳定性、电导率、机械性能和界面电阻,强调机器学习力场和生成模型等前沿建模策略的集成。
当前主流大模型一览,持续跟踪能力边界
关键基准横向对比,数字不说谎
| 模型 | 机构 | MMLU | MATH | HumanEval | 亮点 |
|---|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 90.5 | 87.2 | 89.6 | GPQA 领先 94.1%,长上下文 1M tokens | |
| GPT-5.5 | OpenAI | 92.3 | 91.8 | 90.1 | 综合推理突破,智能指数 60.24 |
| Claude Opus 4.7 | Anthropic | 91.7 | 89.5 | 88.3 | 指令遵循和长期推理优秀 |
| Claude Mythos Preview | Anthropic | 90.8 | 88.1 | 92.4 | 网络安全专用,GPQA 94.6% |
| GPT-5.4 | OpenAI | 91.2 | 90.3 | 91.2 | 1M 上下文窗口,智能指数 56.8 |
| Kimi K2.6 | Moonshot | 89.4 | 85.7 | 87.9 | 开源权重,性价比最高 $0.95/M |
| DeepSeek V4 Pro | DeepSeek | 88.9 | 86.2 | 88.5 | 开源推理模型,智能指数 51.51 |
行业领袖在想什么,说了什么
"人类级 AI 可能在两到三年内到来"
阿莫代警告时间线正在压缩,并在白宫讨论了 Claude Mythos 模型的网络安全能力,该模型可识别软件漏洞并执行完整网络接管攻击。
"12到18个月内实现人类级任务表现"
苏莱曼预测大多数专业任务将在未来一年半内达到人类水平性能,白领工作将面临深远的自动化冲击。
"AGI将如同十次工业革命压缩到十年"
哈萨比斯强调当前系统尚未接近完整人类认知范围,真正的人类级 AGI 仍需多年时间,但其影响将是变革性的。Google 即将在 I/O 大会发布新 Gemini 模型。
每天早上推送到你的邮箱,领袖观点 · 大事 · 论文,不错过 AI 前沿。
分享 AI4Science 前沿、科研心得与个人实验笔记。欢迎来聊。
对话 AI 与科学交叉领域的一线研究者。每期一位,一个问题:AI 正在如何改变你的研究?