Skip to content

Latest commit

 

History

History
102 lines (72 loc) · 4.14 KB

File metadata and controls

102 lines (72 loc) · 4.14 KB

Tip

机器学习加速分子生物学研究。

DOI

Codacy - 代码质量 Codacy - 测试覆盖 CodeCov - 测试覆盖

PyPI - 版本 PyPI - Python 版本 下载统计

授权:AGPL v3

MultiMolecule 是面向分子机器学习的一站式生态。 它把数据集、模型实现、可复用的数据集与神经网络模块、基于 DanLing 的训练评估 runner,以及面向任务的推理 pipeline 串联起来,服务 RNA、DNA 和蛋白质相关工作流。

快速开始

从 PyPI 安装最新稳定版本:

pip install multimolecule

通过 Hugging Face transformers 接口运行已注册的 pipeline:

import multimolecule  # 注册 MultiMolecule 模型和 pipeline
from transformers import pipeline

predictor = pipeline("rna-secondary-structure", model="multimolecule/ernierna-ss")
result = predictor("AUCAGCCUUCGUUCUGUAAACGG")

需要更底层控制时,可以直接加载模型:

import multimolecule

model = multimolecule.AutoModelForSequencePrediction.from_pretrained("multimolecule/basset")
tokenizer = multimolecule.AutoTokenizer.from_pretrained("multimolecule/basset")

如果需要未发布的最新修改,可以从源代码安装:

pip install git+https://github.com/DLS5-Omics/MultiMolecule

浏览

入口 用途
data 感知任务类型的数据集、数据加载和多任务采样。
datasets 生物分子数据集与任务元数据。
io FASTA、DBN、BPSEQ 和 bpRNA ST 读写。
models 支持模型的模型卡与 API 参考。
tokenisers DNA、RNA、蛋白质和 dot-bracket tokeniser。
pipelines 面向具体生物任务的推理流程。
runner 训练、评估和推理配置。
modules 可复用的神经网络构建模块。

社区

  • Discourse:发布公告、使用问题、模型请求、RFC 和社区讨论。
  • GitHub Issues:可复现的错误、API 问题和需要工程跟踪的功能请求。
  • Hugging Face:已发布的 checkpoint、数据集和演示 Space。

引用

Note

本仓库提供的内容是 MultiMolecule 项目的一部分。 如果 MultiMolecule 对你的研究有帮助,请按如下方式引用 MultiMolecule。

@software{chen_2024_12638419,
  author    = {Chen, Zhiyuan and Zhu, Sophia Y.},
  title     = {MultiMolecule},
  doi       = {10.5281/zenodo.12638419},
  publisher = {Zenodo},
  url       = {https://doi.org/10.5281/zenodo.12638419},
  year      = 2024,
  month     = may,
  day       = 4
}

许可证

我们相信开放是研究的基础。

MultiMolecule 在 GNU Affero 通用公共许可证 下授权。

对于额外条款和澄清,请参阅我们的许可协议常见问题解答

请加入我们,共同建立一个开放的研究社区。

SPDX-License-Identifier: AGPL-3.0-or-later