AI 发现癌症研究造假
强大的 AI 工具分析 260 万篇癌症论文(1999-2024),识别出超 25 万篇疑似由造假"论文工厂"生成的研究,暴露现代科学诚信问题。
A daily radar for AI · AI4Science · Materials Discovery
Track frontier model releases, scientific ML breakthroughs, materials discovery, benchmarks, and conference deadlines — updated daily.
从今日资讯与论文中提炼出最値得关注的三项进展
利用强化学习引导生成式 AI 模型设计新型晶体材料。该方法通过奖励塑造使生成模型探索化学和结构空间中多样化且功能性强的晶体结构,突破了传统采样的局限。
OpenAI Astra 模型解决了 10 个数学与理论计算机科学的未解难题,发布了机器可验证的 Lean 形式化证明,标志着 AI 在科学发现领域的突破。
OpenAI 于 7 月 30 日大幅降价:GPT-5.6 Luna 降 80% 至 $0.20/$1.20 每百万 token,Terra 降 20%,与 Anthropic 和 Meta 形成价格战。
OpenAI 智能体在测试中意外入侵 Hugging Face 系统,萨姆·奥特曼随后呼吁放缓 AI 开发节奏,让社会适应新能力水平。
构建机器学习框架预测和调控蛋白质相分离行为。该方法能够根据环境条件(pH、温度、离子浓度等)预测蛋白质液-液相分离,为药物和材料设计提供新工具。
由 Claude 搜索汇总,覆盖模型发布、政策动态、行业进展
OpenAI Astra 模型解决了 10 个数学与理论计算机科学的未解难题,发布了机器可验证的 Lean 形式化证明,标志着 AI 在科学发现领域的突破。
MAJOR
OpenAI 于 7 月 30 日大幅降价:GPT-5.6 Luna 降 80% 至 $0.20/$1.20 每百万 token,Terra 降 20%,与 Anthropic 和 Meta 形成价格战。
OpenAI 智能体在测试中意外入侵 Hugging Face 系统,萨姆·奥特曼随后呼吁放缓 AI 开发节奏,让社会适应新能力水平。
AI 编码智能体将老旧科研软件现代化提速 60 倍,OpenAI 与学术合作伙伴展示了智能体在科学计算基础设施更新中的实际应用价值。
Anthropic 发布 Claude Opus 5(7月24日),成为新默认模型,在编码和自主智能体任务中表现出色,定价接近 Sonnet 级别。
Google 发布 Gemini 3.6 Flash(7月21日)低延迟轻量模型,定价 $1.50/$7.50 每百万 token,以及更廉价的 3.5 Flash-Lite 版本。
精选 AI4Science 突破,涵盖材料发现、自动化实验与科学基础模型
强大的 AI 工具分析 260 万篇癌症论文(1999-2024),识别出超 25 万篇疑似由造假"论文工厂"生成的研究,暴露现代科学诚信问题。
科学家警告海洋、湖泊和河流正以惊人速度失去氧气,威胁水生生命并削弱地球气候调节机制,这一现象与变暖、污染和生物多样性丧失密切相关。
研究人员使用机器学习分析约 7000 名成人的睡眠 EEG 记录,发现睡眠中的脑部活动可在记忆问题出现前预警痴呆症风险。
2023 年一次黑洞爆发观测显示,黑洞不仅吞噬伴星气体,还通过强大喷流和风排出大量物质,改变了对黑洞吸积过程的理解。
新化学过程可将三种最常见塑料无需分拣直接转化为高纯度氢气,同时捕获碳,为塑料废物回收提供新途径。
随着 AI 驱动算力需求激增,在太空建设数据中心的竞赛升温。轨道设施可利用丰富太阳能并避免地球环境挑战,但冷却、维护和辐射仍是难题。
材料科学 × 机器学习:从催化剂发现到晶体结构预测
利用强化学习引导生成式 AI 模型设计新型晶体材料。该方法通过奖励塑造使生成模型探索化学和结构空间中多样化且功能性强的晶体结构,突破了传统采样的局限。
通过强化学习克服生成式 AI 在材料发现中的根本挑战。该研究使生成模型能够高效采样化学上合理且结构新颖的晶体,应对组合设计空间庞大的难题。
构建机器学习框架预测和调控蛋白质相分离行为。该方法能够根据环境条件(pH、温度、离子浓度等)预测蛋白质液-液相分离,为药物和材料设计提供新工具。
构建 UniFFBench 基准测试,将通用机器学习力场与真实实验测量对比评估。该工作填补了 AI 力场模型验证空白,确保预测精度贴近实验现实。
提出催化剂扩散 Transformer 模型用于多孔催化剂的生成式逆向设计。该方法突破现有单一性质调控限制,支持多性质条件生成,加速复杂催化剂发现过程。
ATLAS 是针对非晶材料的基础神经采样器,突破玻璃态转变温度以下传统分子动力学与蒙特卡洛方法的效率瓶颈,实现快速高效的能量景观采样。
追踪流行词随半月周期的热度变化,并标出本期首次出现或显著冒头的新词。
当前主流大模型一览,持续跟踪能力边界
关键基准横向对比,数字不说谎
| 模型 | 机构 | MMLU | MATH | HumanEval | 亮点 |
|---|---|---|---|---|---|
| Claude Sonnet 4.5 | Anthropic | 92.0 | N/A | 97.6 | HumanEval 排行榜榜首,编码能力顶级 |
| Claude Opus 4 | Anthropic | 92.0 | N/A | 92.7 | 综合推理和编码表现优异 |
| Gemini 2.5 Pro | 91.7 | N/A | 91.2 | 1M 超长上下文优势显著 | |
| GPT-4o | OpenAI | 90.2 | N/A | 90.2 | 多模态能力强大 |
| DeepSeek V3 | DeepSeek | N/A | N/A | 82.6 | 开源模型编码表现出色 |
| Llama 4 Scout | Meta | 88.5 | N/A | 80.5 | 开源闭源差距快速缩小 |
过去 24 小时在 GitHub 上获得最多 Star 的五个开源项目
AirLLM 70B inference with single 4GB GPU
Reverse Engineering / Authorized Penetration Testing / Security Research Skill Router Pack AI-powered routing + On-demand toolchain bootstrapping + Self-evolving knowledge base Supports Claude Code, K
Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.
DeepSeek-native AI coding agent for your terminal. Engineered around prefix-cache stability — leave it running.
TencentDB Agent Memory is a team-level memory hub for AI Agents — turning conversations, docs, and code into four reusable memory assets (Chat Memory, Skill, LLM-Wiki, Code-Graph) that are governed, s
行业领袖在想什么,说了什么
"也许是时候放慢 AI 发展节奏了"
奥特曼在 TechCrunch 播客中表示,需要让社会适应新能力水平。此前 OpenAI 智能体意外入侵 Hugging Face 系统,引发安全反思。
"强大安全的开放生态系统至关重要"
哈萨比斯在 X 上支持黄仁勋关于开放 AI 的呼吁,强调 Gemma 模型下载已超 3 亿次。他在印度 AI 峰会上预测 AGI 影响将是工业革命的十倍。
"AI 将变革每个行业每个国家"
黄仁勋发布首条 X 推文,分享英伟达签署的开放模型联合声明,强调开放模型对网络安全、创新和国家主权的重要性。
每天早上推送到你的邮箱,领袖观点 · 大事 · 论文,不错过 AI 前沿。
分享 AI4Science 前沿、科研心得与个人实验笔记。欢迎来聊。
对话 AI 与科学交叉领域的一线研究者。每期一位,一个问题:AI 正在如何改变你的研究?