AI自主科研系统通过同行评审
Nature发表AI Scientist系统,能自主完成从构思到出版的全部科研流程(创意、编码、实验、作图、撰写论文、同行评审),生成的论文通过顶级机器学习会议研讨会首轮评审,接受率70%。
A daily radar for AI · AI4Science · Materials Discovery
Track frontier model releases, scientific ML breakthroughs, materials discovery, benchmarks, and conference deadlines — updated daily.
从今日资讯与论文中提炼出最値得关注的三项进展
Anthropic融资650亿美元,估值达9650亿美元,首次超越OpenAI成为全球最高估值私有AI公司,并于6月2日秘密提交IPO申请文件。
OpenAI、Anthropic、Google DeepMind、微软AI领导人联名致信国会,呼吁立法强制要求合成DNA供应商筛查订单和客户身份,防范AI辅助生物武器风险。
微软Build 2026发布MAI系列7款自研模型,包括推理旗舰MAI-Thinking-1、编程模型MAI-Code-1-Flash及图像生成MAI-Image-2.5,全部由微软独立训练,非OpenAI提供。
由 Claude 搜索汇总,覆盖模型发布、政策动态、行业进展
Anthropic融资650亿美元,估值达9650亿美元,首次超越OpenAI成为全球最高估值私有AI公司,并于6月2日秘密提交IPO申请文件。
OpenAI、Anthropic、Google DeepMind、微软AI领导人联名致信国会,呼吁立法强制要求合成DNA供应商筛查订单和客户身份,防范AI辅助生物武器风险。
微软Build 2026发布MAI系列7款自研模型,包括推理旗舰MAI-Thinking-1、编程模型MAI-Code-1-Flash及图像生成MAI-Image-2.5,全部由微软独立训练,非OpenAI提供。
ChatGPT Dreaming V3架构于6月4日向美国Plus和Pro用户推送,在对话结束后自动后台合成用户偏好、约束和项目背景,无需显式要求即可记忆。
Cognition旗下Devin以260亿美元估值融资10亿美元,SoftBank承诺在法国投入750亿欧元建设5GW AI基础设施。
GitHub Copilot于6月1日全面转向按Token计费,开发者强烈反对,有用户报告月费用从29美元飙升至750美元。
Sysdig记录首例确认的LLM Agent自主网络攻击,该攻击在一小时内自主渗透并导出AWS数据库。
阿里Qwen 3.7 Max在Agent基准测试上接近Claude Opus 4.7性能,但输入成本约为其一半,输出成本仅四分之一,适合高容量生产负载。
亚马逊定制芯片业务(Graviton、Trainium、Nitro)年营收已突破200亿美元,同比增长超100%,成为全球前三大数据中心芯片业务之一。
中国科协撤销对NeurIPS 2026的学术认可,停止资助学者参会,并规定该会议论文不得作为代表性成果申报项目,引发顶会审稿危机。
精选 AI4Science 突破,涵盖材料发现、自动化实验与科学基础模型
Nature发表AI Scientist系统,能自主完成从构思到出版的全部科研流程(创意、编码、实验、作图、撰写论文、同行评审),生成的论文通过顶级机器学习会议研讨会首轮评审,接受率70%。
科学家创建超薄芯片,在单一器件内生成、操控和读取光信息,利用原子级薄材料和纳米级结构,为超快、低功耗计算和量子计算带来重大飞跃。
伯明翰大学开发钙钛矿基催化剂,在远低于传统温度下将水分解为氢气,可能使清洁燃料生产变得更便宜和更容易。
氯氧化钼晶体可能助力智能隐形眼镜和超薄AR眼镜等未来技术,科学家首次绘制其光学性质的详细实验图谱,揭示独特双重特性。
卡尔斯鲁厄理工学院研究人员使用大语言模型和概念图分析材料科学文献,能提前2-3年预测新兴研究趋势,为研究者提供跨学科合作灵感。
Boston Dynamics与Google Cloud及DeepMind合作,将Gemini Robotics-ER 1.6集成至Spot机器狗和Orbit AI视觉检测平台,增强空间推理和自主决策能力。
材料科学 × 机器学习:从催化剂发现到晶体结构预测
当前主流大模型一览,持续跟踪能力边界
关键基准横向对比,数字不说谎
| 模型 | 机构 | MMLU | MATH | HumanEval | 亮点 |
|---|---|---|---|---|---|
| Claude Opus 4.8 | Anthropic | N/A | N/A | 97.6 | SWE-Bench Pro 69.2%领先,Agent任务全面最强 |
| Claude Sonnet 4.5 | Anthropic | N/A | N/A | 97.6 | HumanEval排行榜当前第一 |
| GPT-5.5 | OpenAI | N/A | N/A | N/A | Terminal-Bench 2.1达78.2%,终端编程最强 |
| Gemini 3.5 Flash | N/A | N/A | N/A | 多模态领先,CharXiv 84.2%,速度快4倍 | |
| Gemini 3.1 Pro | 94.3 | N/A | N/A | MMLU领先,原生多模态支持,1M上下文 | |
| Qwen 3.7 Max | 阿里巴巴 | 88.4 | N/A | N/A | Agent基准接近Opus 4.7,成本效益突出 |
行业领袖在想什么,说了什么
"编程模型是当前AI需求的最大驱动力"
在Stargate密歇根数据中心接受采访时,奥特曼明确指出编程模型是AI需求的单一最大驱动因素。同时,OpenAI宣布将配合特朗普行政令,在公开发布前30天提供模型供联邦安全审查。
"我们不会移除针对大规模监控的防护措施"
6月5日,阿莫代与奥特曼、哈萨比斯等联名致信美国国会,呼吁强制筛查合成DNA订单以防生物武器风险。此前他明确拒绝五角大楼要求Anthropic移除对大规模国内监控和自主武器的防护。
"我们能把技术立即部署到数十亿用户产品中"
在斯坦福商学院炉边谈话中,哈萨比斯预测AGI将在2030年前后到达,并强调Google的独特优势在于能将AI技术快速整合到搜索、YouTube等大规模产品中,而非仅追求基准测试霸榜。
每天早上推送到你的邮箱,领袖观点 · 大事 · 论文,不错过 AI 前沿。
分享 AI4Science 前沿、科研心得与个人实验笔记。欢迎来聊。
对话 AI 与科学交叉领域的一线研究者。每期一位,一个问题:AI 正在如何改变你的研究?