GitHub AI4S 项目观察(2026-08-07—2026-08-13)
2026/8/17 19:57:57 网站建设 项目流程

项目速览

项目Star 数(统计时间)主要功能AI4S 领域本期动态
ToolUniverse1,627(2026-08-14 10:12)让 AI 模型统一检索、调用并组合科学数据、模型和软件工具科研智能体、生物医药与科研数据v1.4.1 提升数据返回可靠性与安装体验
ForgeStencil60(2026-08-14 13:55)用双智能体发现 CUDA 模板计算优化策略,并集成到真实应用中验证高性能计算、GPU 优化、科学计算智能体8 月 4 日首次公开,提供 100 个应用复现包
ColabFold2,876(2026-08-14 10:12)从蛋白质序列生成三维结构、复合物模型与置信度结果结构生物学、蛋白质研究增加复合物界面置信度评分
BioNeMo Recipes843(2026-08-14 10:12)提供可扩展的生物基础模型训练、微调与推理参考流程生物医药、基因组与药物发现Evo2 支持并行批量生成
Scanpy2,539(2026-08-14 10:12)从单细胞表达矩阵完成质控、聚类、轨迹和差异基因分析单细胞组学、生物信息学优化 Harmony 批次整合默认设置

1. ToolUniverse:让 AI 先找到合适的科学工具,再按统一方式执行

ToolUniverse 是一个为科研智能体准备的开源工具平台。科研智能体是能够根据任务自行选择并调用工具的 AI 程序。可以把 ToolUniverse 理解成科学工具的“统一目录和转接层”:语言模型不必分别学习每个数据库、分析软件和预测模型的调用方式,只需按照同一套说明查找工具、填写参数并读取结果。它不是替研究者下结论的聊天机器人,主要作用是把原本分散的科研资源连接起来。

用户提出科研任务后,ToolUniverse 会先从工具库中筛选合适的选项,检查参数,再调用相应服务。多个工具既可以依次执行,也可以并行运行,或者根据前一步结果反复调整。据项目论文 2026 年 7 月的统计,工具库当时已经收录超过 2,700 个工具,涉及数据集、机器学习模型、科学软件、文献检索和实验接口等类别。任务结束后,系统会留下查询结果、模型预测、证据汇总和调用记录,方便研究者检查每一步用了什么数据、做了什么操作。

该项目由哈佛医学院生物医学信息学系牵头,哈佛大学、麻省理工学院及相关研究机构参与。本期发布的 v1.4.1 增加了基因安全性评估流程,并修复了若干数据返回和安装问题。

图:ToolUniverse 统一管理科学工具与领域技能,再把它们交给语言模型或智能体完成假设生成、实验设计、数据分析和证据汇总;来源:ToolUniverse 原始论文,Figure 1。

资料来源:官方 GitHub 仓库(访问日期:2026-08-14);哈佛医学院项目团队页面(访问日期:2026-08-14);v1.4.1 Release(发布:2026-08-12;访问日期:2026-08-14);原始论文(修订:2026-08-07;访问日期:2026-08-14)。

2. ForgeStencil:让智能体把模板计算优化真正部署进科学软件

ForgeStencil 是一套用大语言模型智能体优化 CUDA 科学计算程序的开源系统,主要面向模板计算(Stencil Computation)的性能优化。在这类计算中,规则网格上每个点的新值都由自身和周围一小片邻域共同决定。流体力学、电磁仿真、气候模拟和医学成像中都能见到这种模式。模板计算往往要在大规模网格上重复很多次,因此,即使单次更新只快一点,也可能显著缩短整个程序的运行时间。

ForgeStencil 使用两个分工不同的智能体。Kernel Agent 负责研究底层计算内核,在“规划—编码—性能分析”的循环中尝试分块、融合、数据布局和主机端重构等办法,并把效果较好的 CUDA 内核放入库中。App Agent 面向具体软件,先找出最耗时的部分,再选择或改造合适的内核,将它接入原程序。接入后,系统使用应用自带的正确性检查和计时器,对原始版本与优化版本进行交错测试。这样留下的不只是一个代码片段,还包括集成补丁、软件来源记录、复现脚本和端到端性能数据。

Kernel Agent
规划—编码—性能分析

优化内核库

App Agent
热点定位—适配—集成

应用内正确性检查
交错性能测量

结果注册表

图:ForgeStencil 先由 Kernel Agent 生成并积累优化内核,再由 App Agent 将内核部署到真实应用中验证;根据项目官方架构图整理。

项目由 OpenBMB 组织开源,仓库于 2026-08-04 首次公开。仓库为 100 个应用准备了复现包,涉及油气、电磁、医学成像、流体、气候、天体物理和材料等场景。项目自己的结果注册表显示,端到端加速的中位数为 1.41 倍,几何平均为 2.05 倍。这些数字需要结合测试条件理解:目前 100 个应用只在 A100 上完成了端到端验证,实际速度还会受到 GPU 型号、节点负载和原程序优化程度的影响;如果应用自带的正确性检查不够严格,验证结果也会受到限制。

资料来源:官方 GitHub 仓库(访问日期:2026-08-14);中文项目说明(访问日期:2026-08-14);双智能体工作机制(访问日期:2026-08-14);GitHub API 仓库记录(仓库创建:2026-08-04 00:22,Asia/Shanghai;访问日期:2026-08-14)。

3. ColabFold:从蛋白质序列快速得到三维结构与可信度线索

ColabFold 是一套免费、开源且较容易上手的蛋白质结构预测工具。它不是 AlphaFold2 的简单“社区复刻版”,也没有重新发明一个结构预测模型;它所做的,是把 AlphaFold2 等模型与更快的序列搜索方法组合起来,再封装成可在浏览器中运行的 Google Colab 笔记本和命令行程序。这种组合既简化了安装和使用步骤,也缩短了序列搜索与数据准备时间,让没有专门计算团队的实验室也能较方便地开展结构预测。

使用者只需提供 FASTA 或 CSV 格式的氨基酸序列,也可以一次提交由多条蛋白链组成的复合物。ColabFold 首先用 MMseqs2 寻找相似序列,并建立多序列比对。所谓多序列比对,就是把一批相关蛋白质的序列按照同源位置排齐。空间上彼此关联的氨基酸位置,往往会在演化过程中表现出协同变化;这些规律能为蛋白质的三维结构提供线索。随后,AlphaFold 系列模型会利用这些信息预测蛋白质单体或复合物的三维形状。

预测完成后,ColabFold 会给出 PDB 三维坐标、可视化图片和多种置信度指标。这些指标能帮助研究者判断哪些局部结构较可靠、哪些链间接触值得进一步验证,但预测结果仍不能代替实验测定。项目由德国马克斯·普朗克多学科科学研究所、首尔大学、东京大学、密歇根州立大学和哈佛大学等机构合作开发。本期没有发布新版本,不过新增了两项复合物界面置信度评分,使链间结合的判断更直观。

图:使用者可以从网页或命令行提交序列。ColabFold 经 MMseqs2 生成多序列比对,再预测单体或复合物结构,并给出序列覆盖度和置信度图;来源:ColabFold 原始论文,Figure 1。

资料来源:官方 GitHub 仓库(访问日期:2026-08-14);原始论文与机构信息(在线发表:2022-05-30;访问日期:2026-08-14);本周期功能提交(提交:2026-08-10 13:54,Asia/Shanghai;访问日期:2026-08-14)。

4. BioNeMo Recipes:把生物基础模型原型扩展到多 GPU 训练与批量生成

BioNeMo Recipes 是 NVIDIA 开源的一组生物基础模型训练配方和参考代码。这里的“配方”不是一个可以直接点开使用的应用,而是一套经过组织的示例:数据怎样准备、模型怎样配置、训练怎样从一张 GPU 扩展到多台机器,都能在代码中找到对应做法。生物基础模型则是从大量蛋白质、DNA 或单细胞数据中学习一般规律的大模型,之后还可以针对具体研究任务继续训练。

项目为 ESM-2、Geneformer、AMPLIFY 和基因组模型等方向提供参考流程,并尽量与常见的 PyTorch 工具兼容。研究者可以从已有检查点继续预训练或微调,训练过程会产生新的模型检查点和日志;也可以使用训练好的模型执行推理,得到生成序列等结果。基准测试脚本还会记录吞吐量,帮助使用者比较不同训练配置的运行效率。BioNeMo Recipes 的价值在于提供一套可修改、可扩展的工程起点,而不是替使用者包办数据处理和模型选择。要真正运行这些配方,仍然需要相应的 GPU 资源和分布式训练经验。

BioNeMo Recipes 由 NVIDIA BioNeMo 团队维护。本期更新为基因组基础模型 Evo2 加入了并行批量生成能力,使多条输入序列可以同时推理;项目同时更新了部分运行环境配置。

图:官方 ESM-2 预训练配方在两节点、16 张 GPU 上比较不同训练实现的每卡吞吐量,用于说明 Recipes 面向可扩展训练的定位;来源:BioNeMo Recipes 官方文档。

资料来源:官方 GitHub 仓库(访问日期:2026-08-14);NVIDIA BioNeMo 官方文档(访问日期:2026-08-14);本周期功能提交(提交:2026-08-08 02:43,Asia/Shanghai;访问日期:2026-08-14);BioNeMo Framework 原始论文(访问日期:2026-08-14)。

5. Scanpy:把单细胞表达矩阵变成细胞群、标记基因和变化轨迹

Scanpy 是一个用 Python 分析单细胞基因表达数据的开源工具箱。它把数据清洗、统计分析和可视化步骤放在同一套工作流程中。单细胞测序会分别记录许多细胞中各个基因的活跃程度,得到一张规模很大的“细胞 × 基因”表达矩阵。Scanpy 使用 AnnData 格式保存这张矩阵,同时记录样本来源、细胞类型和基因注释等信息。

分析通常从去除低质量细胞、统一不同细胞的表达量开始。随后,Scanpy 可以把包含数千个基因的高维表达数据压缩成较少的特征,再根据这些特征寻找相似细胞、划分细胞群,并比较不同细胞群中哪些基因更活跃。研究者由此可以获得二维分布图、细胞群标签、标记基因表,以及描述细胞发育或状态变化的轨迹。对于来自不同实验批次的数据,Scanpy 还可以调用 Harmony 等方法减小技术差异,避免把实验条件造成的偏差误认为真实的生物差异。

项目由 scverse 开源共同体维护,并由 NumFOCUS 提供财政支持。本期更新调整了 Harmony 第二代实现的默认停止条件,让算法在结果已经稳定时及时停止,减少不必要的迭代;项目还完成了少量文档维护。

图:Scanpy 从预处理和可视化进入聚类、差异表达与伪时间轨迹分析,并展示大规模单细胞数据的结果;来源:Scanpy 原始论文,Figure 1。

资料来源:官方 GitHub 仓库(访问日期:2026-08-14);scverse 官方介绍(访问日期:2026-08-14);本周期功能提交(提交:2026-08-13 22:59,Asia/Shanghai;访问日期:2026-08-14);原始论文(发表:2018-02-06;访问日期:2026-08-14)。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询