Views
No views yet
gradientai/Llama-3-8B-Instruct-262kWrite information about the nucleotide sequence.
### Sequence:
∎G∎C∎C∎T∎A∎T∎A∎G∎T∎G∎T∎G∎T∎A∎G...
### Annotation:
Information about location in the kaniwa chromosome: >lcl|Cp51from peft import AutoPeftModelForCausalLM
2from transformers import AutoTokenizer
3
4model = AutoPeftModelForCausalLM.from_pretrained("monsoon-nlp/llama3-biotokenpretrain-kaniwa", load_in_4bit=True).to("cuda")
5tokenizer = AutoTokenizer.from_pretrained("monsoon-nlp/llama3-biotokenpretrain-kaniwa")
6tokenizer.pad_token = tokenizer.eos_token # pad fix
7
8qed = "∎" # from math symbols, used in pretraining
9sequence = "".join([(qed + nt.upper()) for nt in "GCCTATAGTGTGTAGCTAATGAGCCTAGGTTATCGACCCTAATCT"])
10
11inputs = tokenizer(f"{prefix}{sequence}{annotation}", return_tensors="pt")
12outputs = model.generate(input_ids=inputs["input_ids"].to("cuda"), max_new_tokens=50)
13sample = tokenizer.batch_decode(outputs, skip_special_tokens=False)[0]1from transformers import AutoTokenizer
2from trl import SFTTrainer
3from unsloth import FastLanguageModel
4
5model, _ = FastLanguageModel.from_pretrained(
6 model_name = "monsoon-nlp/llama3-biotokenpretrain-kaniwa",
7 max_seq_length = 7_000, # max 6,000 bp for AgroNT tasks
8 dtype = None,
9 load_in_4bit = True,
10 resize_model_vocab=128260, # includes biotokens
11)
12tokenizer = AutoTokenizer.from_pretrained("monsoon-nlp/llama3-biotokenpretrain-kaniwa")
13tokenizer.pad_token = tokenizer.eos_token # pad fix
14
15trainer = SFTTrainer(
16 model = model,
17 tokenizer = tokenizer,
18...
19)