Views
No views yet
| Use case | Description |
|---|---|
| Score model training | Takes processed PDBBind or MOAD data as input and outputs a DiffDock score model checkpoint |
| Single-complex molecular docking | Takes a protein PDB file and a ligand SMILES/SDF/MOL2 input, and outputs candidate ligand binding conformations in SDF format |
| Batch molecular docking | Takes a CSV file containing proteins, ligands, and complex names, and outputs sampled conformations in batches |
| Confidence rerank | Uses an additional confidence model to rank sampled conformations |
| Dataset evaluation | Computes metrics such as RMSD for sampling results on a validation or test set, with optional GNINA integration |
gnina separately.nvidia-smihy-smi1conda create -n onescience311 python=3.11 -y
2conda activate onescience311
3pip install onescience[bio] -i http://mirrors.onescience.ai:3141/pypi/simple/ --trusted-host mirrors.onescience.ai1source ${ROCM_PATH}/cuda/env.sh
2export LD_LIBRARY_PATH="$CONDA_PREFIX/lib:$LD_LIBRARY_PATH"
3export LD_LIBRARY_PATH="$CONDA_PREFIX/lib/python3.11/site-packages/fastpt/torch/lib:$LD_LIBRARY_PATH"1# If the model ID on the Hugging Face page uses different capitalization, use the actual published name.
2hf download OneScience-Group/diffdock --local-dir ./diffdock
3cd diffdockfind . -maxdepth 3 -type fmodel_parameters.yml.configs/training.yml to local paths. Common fields include:data.pdbbind_dir: processed PDBBind data directory.data.moad_dir: processed MOAD data directory.data.split_train: list of training-set complexes.data.split_val: list of validation-set complexes.runtime.log_dir: training output directory.1cd scripts
2bash train.shmodel_parameters.yml: model architecture and training parameters.best_model.pt: weights with the best validation loss.best_ema_model.pt: EMA weights.best_inference_epoch_model.pt or best_ema_inference_epoch_model.pt: weights saved when inference validation is enabled.last_model.pt: training state from the final epoch.1outputs/train/diffdock_cg_example/
2├── model_parameters.yml
3└── best_model.ptconfigs/sampling.yml to the actual paths:model.model_dir: score model directory.model.ckpt: score checkpoint file name.confidence.confidence_model_dir: confidence model directory; set it to null when rerank is not used.input.protein_path: protein PDB path. You can use data/6o5u_protein_processed.pdb.input.ligand_description: SMILES string or ligand SDF/MOL2 path. You can use data/6o5u_ligand.sdf.runtime.out_dir: sampling output directory.1cd scripts
2bash infer.shinput.protein_ligand_csv in configs/sampling.yml to the CSV path, and set the single-complex fields to null as needed. The CSV is recommended to contain the following columns:complex_name,protein_path,ligand_description,protein_sequenceligand_description can be either a SMILES string or an SDF/MOL2 file path.configs/evaluate.yml to actual paths:python -m scripts.evaluate --config configs/evaluate.ymlgnina.gnina_minimize=true is enabled, first make sure the following command can be run directly in the current environment:gnina --help1python -m onescience.confidence.diffdock.confidence_train \
2 --original_model_dir outputs/train/diffdock_cg_example \
3 --data_dir /path/to/PDBBind_processed \
4 --split_train /path/to/splits/timesplit_no_lig_overlap_train \
5 --split_val /path/to/splits/timesplit_no_lig_overlap_val1${ONESCIENCE_DATASETS_DIR}/diffdock/
2├── PDBBind_processed/
3├── MOAD_processed/
4└── splits/
5 ├── timesplit_no_lig_overlap_train
6 ├── timesplit_no_lig_overlap_val
7 └── timesplit_test| Platform | OneScience main repository | Skills repository |
|---|---|---|
| Gitee | https://gitee.com/onescience-ai/onescience | https://gitee.com/onescience-ai/oneskills |
| GitHub | https://github.com/onescience-ai/OneScience | https://github.com/onescience-ai/oneskills |
1@inproceedings{corso2023diffdock,
2 title={DiffDock: Diffusion Steps, Twists, and Turns for Molecular Docking},
3 author={Corso, Gabriele and St{\"a}rk, Hannes and Jing, Bowen and Barzilay, Regina and Jaakkola, Tommi},
4 booktitle={International Conference on Learning Representations},
5 year={2023}
6}