Views
No views yet

transformers from main until transformers=4.39.0 is released.pip install git+https://github.com/huggingface/transformers@maincausal_conv_1d and mamba-ssm using:1pip install causal-conv1d>=1.2.0
2pip install mamba-ssmcuda kernels will be used.generate API:
setup (For Cuda)1from transformers import MambaConfig, MambaForCausalLM, AutoTokenizer
2import torch
3device = torch.device('cuda:0')
4tokenizer = AutoTokenizer.from_pretrained("Kalamazooter/RatelSlang-Micro-130M")
5model = MambaForCausalLM.from_pretrained("Kalamazooter/RatelSlang-Micro-130M")
6model = model.to(device)1input_ids = tokenizer("**Vraag: Ik heb 4 schapen, per schaap heb ik 3 lammetjes, hoeveel lammetjes heb ik?\n\n Antwoord:", return_tensors="pt").input_ids.to(device)
2out = model.generate(input_ids, max_new_tokens=50)
3print(tokenizer.batch_decode(out))
4['<s> **Vraag: Ik heb 4 schapen, per schaap heb ik 3 lammetjes, hoeveel lammetjes heb ik?\n\n Antwoord:\n\n1. Bereken het aantal lammetjes dat je hebt: 4 schapen x 3 lammetjes per schaap = 12 lammetjes\n2. Bereken het aantal lammetjes dat je hebt: 12 lam']peft library, it is recommend to keep the model in float32!1from datasets import load_dataset
2from trl import SFTTrainer
3from peft import LoraConfig
4from transformers import AutoTokenizer, AutoModelForCausalLM, TrainingArguments
5tokenizer = AutoTokenizer.from_pretrained("Kalamazooter/RatelSlang-Micro-130M")
6model = AutoModelForCausalLM.from_pretrained("Kalamazooter/RatelSlang-Micro-130M")
7dataset = load_dataset("Abirate/english_quotes", split="train")
8training_args = TrainingArguments(
9 output_dir="./results",
10 num_train_epochs=3,
11 per_device_train_batch_size=4,
12 logging_dir='./logs',
13 logging_steps=10,
14 learning_rate=2e-3
15)
16lora_config = LoraConfig(
17 r=8,
18 target_modules=["x_proj", "embeddings", "in_proj", "out_proj"],
19 task_type="CAUSAL_LM",
20 bias="none"
21)
22trainer = SFTTrainer(
23 model=model,
24 tokenizer=tokenizer,
25 args=training_args,
26 peft_config=lora_config,
27 train_dataset=dataset,
28 dataset_text_field="quote",
29)
30trainer.train()