Tip
机器学习加速分子生物学研究。
MultiMolecule 是面向分子机器学习的一站式生态。 它把数据集、模型实现、可复用的数据集与神经网络模块、基于 DanLing 的训练评估 runner,以及面向任务的推理 pipeline 串联起来,服务 RNA、DNA 和蛋白质相关工作流。
从 PyPI 安装最新稳定版本:
pip install multimolecule通过 Hugging Face transformers 接口运行已注册的 pipeline:
import multimolecule # 注册 MultiMolecule 模型和 pipeline
from transformers import pipeline
predictor = pipeline("rna-secondary-structure", model="multimolecule/ernierna-ss")
result = predictor("AUCAGCCUUCGUUCUGUAAACGG")需要更底层控制时,可以直接加载模型:
import multimolecule
model = multimolecule.AutoModelForSequencePrediction.from_pretrained("multimolecule/basset")
tokenizer = multimolecule.AutoTokenizer.from_pretrained("multimolecule/basset")如果需要未发布的最新修改,可以从源代码安装:
pip install git+https://github.com/DLS5-Omics/MultiMolecule| 入口 | 用途 |
|---|---|
data |
感知任务类型的数据集、数据加载和多任务采样。 |
datasets |
生物分子数据集与任务元数据。 |
io |
FASTA、DBN、BPSEQ 和 bpRNA ST 读写。 |
models |
支持模型的模型卡与 API 参考。 |
tokenisers |
DNA、RNA、蛋白质和 dot-bracket tokeniser。 |
pipelines |
面向具体生物任务的推理流程。 |
runner |
训练、评估和推理配置。 |
modules |
可复用的神经网络构建模块。 |
- Discourse:发布公告、使用问题、模型请求、RFC 和社区讨论。
- GitHub Issues:可复现的错误、API 问题和需要工程跟踪的功能请求。
- Hugging Face:已发布的 checkpoint、数据集和演示 Space。
Note
本仓库提供的内容是 MultiMolecule 项目的一部分。 如果 MultiMolecule 对你的研究有帮助,请按如下方式引用 MultiMolecule。
@software{chen_2024_12638419,
author = {Chen, Zhiyuan and Zhu, Sophia Y.},
title = {MultiMolecule},
doi = {10.5281/zenodo.12638419},
publisher = {Zenodo},
url = {https://doi.org/10.5281/zenodo.12638419},
year = 2024,
month = may,
day = 4
}我们相信开放是研究的基础。
MultiMolecule 在 GNU Affero 通用公共许可证 下授权。
对于额外条款和澄清,请参阅我们的许可协议常见问题解答。
请加入我们,共同建立一个开放的研究社区。
SPDX-License-Identifier: AGPL-3.0-or-later