强化学习控制量子纠错
Sivak 等在 Nature(7月8日)报道用强化学习实时优化量子纠错流程,显著降低逻辑错误率,为容错量子计算提供实用途径。
A daily radar for AI · AI4Science · Materials Discovery
Track frontier model releases, scientific ML breakthroughs, materials discovery, benchmarks, and conference deadlines — updated daily.
从今日资讯与论文中提炼出最値得关注的三项进展
结合强化学习与生成式 AI,系统地引导模型探索化学可行且多样化的新型晶体结构,突破传统组合设计空间的局限,为功能晶体材料发现提供高效途径。
月之暗面正式发布 Kimi K3,首个 3 万亿参数级开源模型(2.8T 有效参数,1M token 原生视觉上下文),完整权重将于 7 月 27 日发布。已在 Kimi 全系产品上线。
29 国在上海签署协议成立世界人工智能合作组织(WAICO),独立政府间机构总部设在上海,联合国秘书长古特雷斯出席。俄罗斯、巴西、印尼、古巴等参与。
TSMC Q2 财报:营收暴涨 77.4% YoY 至 7066 亿新台币(约 220 亿美元),资本支出上调至 600-640 亿美元,宣布亚利桑那州再投 1000 亿美元(美国总承诺达 2650 亿)。
苹果智能(Apple Intelligence)获中国网信办批准,使用阿里通义千问模型(百度亦参与),清除主要监管障碍。具体上线日期未公布。
由 Claude 搜索汇总,覆盖模型发布、政策动态、行业进展
月之暗面正式发布 Kimi K3,首个 3 万亿参数级开源模型(2.8T 有效参数,1M token 原生视觉上下文),完整权重将于 7 月 27 日发布。已在 Kimi 全系产品上线。
MAJOR
29 国在上海签署协议成立世界人工智能合作组织(WAICO),独立政府间机构总部设在上海,联合国秘书长古特雷斯出席。俄罗斯、巴西、印尼、古巴等参与。
TSMC Q2 财报:营收暴涨 77.4% YoY 至 7066 亿新台币(约 220 亿美元),资本支出上调至 600-640 亿美元,宣布亚利桑那州再投 1000 亿美元(美国总承诺达 2650 亿)。
Google 将 NotebookLM 更名为 Gemini Notebook,为每个笔记本添加安全云计算环境,支持原生代码执行和数据分析,与 Gemini App 跨应用同步。
苹果智能(Apple Intelligence)获中国网信办批准,使用阿里通义千问模型(百度亦参与),清除主要监管障碍。具体上线日期未公布。
PrismML 发布 Bonsai 27B,将 270 亿参数模型压缩至 3.9GB,可在 iPhone 17 Pro 上以约 11 token/s 运行,1-bit 版本保留 90% 以上性能(Apache 2.0 许可)。
超 200 名经济学家和 AI 研究者(含 16 位诺奖得主)发布公开信,呼吁各国政府立即为 AI 经济冲击做准备,警告变革规模超工业革命但展开速度更快。
精选 AI4Science 突破,涵盖材料发现、自动化实验与科学基础模型
Sivak 等在 Nature(7月8日)报道用强化学习实时优化量子纠错流程,显著降低逻辑错误率,为容错量子计算提供实用途径。
Fry 等(Nature, 6月24日)提出神经迭代选择-扩展框架,实现零样本条件下设计与小分子药物结合的蛋白质,同步优化序列、结构和配体构象。
Park 等(Nature Machine Intelligence, 7月6日)通过强化学习引导生成式 AI 模型探索多样化新型晶体结构,突破传统组合设计空间限制。
Obermeyer 等(Nature, 6月24日)用深度学习从心电图中发现心源性猝死新生物标志物,突破传统预测模型局限。
Hou 等(Nature Computational Science, 7月14日)构建信息超材料生成式模型,实现电磁功能材料快速逆向设计。
Fu 等(Nature Computational Science, 7月10日)提出局部赝势方案,将神经网络量子蒙特卡洛模拟速度提升数倍,保持 ab initio 精度。
材料科学 × 机器学习:从催化剂发现到晶体结构预测
结合强化学习与生成式 AI,系统地引导模型探索化学可行且多样化的新型晶体结构,突破传统组合设计空间的局限,为功能晶体材料发现提供高效途径。
提出面向信息超材料的生成式模型,实现电磁功能材料的快速逆向设计和优化,大幅缩短从性能需求到结构设计的周期。
通过引入局部赝势方法,显著加速神经网络波函数的量子蒙特卡洛模拟,保持接近 ab initio 的精度,为大规模量子化学计算开辟实用路径。
构建首个系统评估通用机器学习力场的基准(UniFFBench),将模型预测与实验测量直接对比,揭示当前 MLFF 在真实材料体系中的精度边界。
提出神经迭代选择-扩展深度学习框架,实现零样本条件下同步优化蛋白质序列、结构和小分子配体构象,显著提升药物靶标蛋白的从头设计能力。
针对催化剂逆向设计,提出对比学习框架 CatRetriever,实现从表面吸附构型到体相材料的高效检索,加速生成式催化剂发现流程。
提出 EquiFiLM,通过特征线性调制将电荷状态纳入等变力场,使通用 MLFF(如 MACE-MP-0)能够处理电子态变化,扩展适用范围至电化学和激发态。
系统分析 SO(2) 理论在机器学习原子间势中的局限,提出直角坐标边簇展开结合径向旋转注意力,在保持效率的同时逼近 SO(3) Clebsch-Gordan 张量积表达能力。
追踪流行词随半月周期的热度变化,并标出本期首次出现或显著冒头的新词。
当前主流大模型一览,持续跟踪能力边界
关键基准横向对比,数字不说谎
| 模型 | 机构 | MMLU | MATH | HumanEval | 亮点 |
|---|---|---|---|---|---|
| Claude Fable 5 | Anthropic | N/A | N/A | N/A | 综合质量指数 100/100(Swfte 排行榜),SWE-bench Verified 95.0% |
| GPT-5.6 Sol | OpenAI | N/A | N/A | N/A | 网络安全和生物学专项优化,长周期 Agent 基准领先 |
| Claude Opus 4.8 | Anthropic | N/A | N/A | N/A | SWE-bench Verified 88.6%,SWE-bench Pro 69.2% |
| Gemini 3.1 Pro | N/A | N/A | N/A | SWE-bench Verified 约 80%,多模态推理强 | |
| Grok 4.5 | xAI | N/A | N/A | N/A | 价格性能比突出,Terminal-Bench 编码基准优异 |
| GPT-5 | OpenAI | 92.5 | N/A | N/A | MMLU 排行榜(100 模型)当前冠军 |
| Claude Sonnet 5 | Anthropic | N/A | N/A | N/A | Agent 编码基准 63.2%(vs Sonnet 4.6 的 58.1%) |
过去 24 小时在 GitHub 上获得最多 Star 的五个开源项目
Master programming by recreating your favorite technologies from scratch.
🦔 PostHog is the leading platform for building self-driving products. Our developer tools – AI observability, analytics, session replay, flags, experiments, error tracking, logs, and more – capture al
Become a cracked AI/ML Research Engineer
Anti-AI-slop design skill for Claude Code, Cursor, and Codex.
Multi-platform SDK for integrating GitHub Copilot Agent into apps and services
行业领袖在想什么,说了什么
"前沿 AI 需要独立第三方测试"
7月15日发布 AI 监管框架提案,呼吁建立类似 FINRA 的行业资助、联邦监督的标准机构,对前沿模型实施发布前审查。获得 Altman、Nadella 和 Musk 罕见公开支持。
"建立类似 IAEA 的全球 AI 论坛"
在 G7 峰会(6月17日)和 FT 撰文中提出,美国应主导国际 AI 标准制定,通过市场准入作为杠杆推动各国合规。同时 OpenAI 提议向美政府出让 5% 股权(价值 426 亿美元)。
"民主国家应避免因 AI 工具分裂"
6月17日 G7 峰会呼吁美国领导的联盟协调 AI 部署,强调网络和生物安全风险。5月修正此前「AI 将淘汰 50% 白领工作」预测,称自动化将扩展而非消灭工作。
每天早上推送到你的邮箱,领袖观点 · 大事 · 论文,不错过 AI 前沿。
分享 AI4Science 前沿、科研心得与个人实验笔记。欢迎来聊。
对话 AI 与科学交叉领域的一线研究者。每期一位,一个问题:AI 正在如何改变你的研究?