Views
No views yet

1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3tokenizer = AutoTokenizer.from_pretrained("google/gemma-7b")
4model = AutoModelForCausalLM.from_pretrained("google/gemma-7b")
5
6input_text = "Write me a poem about Machine Learning."
7input_ids = tokenizer(input_text, return_tensors="pt")
8
9outputs = model.generate(**input_ids)
10print(tokenizer.decode(outputs[0]))1# pip install accelerate
2from transformers import AutoTokenizer, AutoModelForCausalLM
3
4tokenizer = AutoTokenizer.from_pretrained("google/gemma-7b")
5model = AutoModelForCausalLM.from_pretrained("google/gemma-7b", device_map="auto")
6
7input_text = "Write me a poem about Machine Learning."
8input_ids = tokenizer(input_text, return_tensors="pt").to("cuda")
9
10outputs = model.generate(**input_ids)
11print(tokenizer.decode(outputs[0]))torch.float161# pip install accelerate
2from transformers import AutoTokenizer, AutoModelForCausalLM
3
4tokenizer = AutoTokenizer.from_pretrained("google/gemma-7b")
5model = AutoModelForCausalLM.from_pretrained("google/gemma-7b", device_map="auto", torch_dtype=torch.float16)
6
7input_text = "Write me a poem about Machine Learning."
8input_ids = tokenizer(input_text, return_tensors="pt").to("cuda")
9
10outputs = model.generate(**input_ids)
11print(tokenizer.decode(outputs[0]))torch.bfloat161# pip install accelerate
2from transformers import AutoTokenizer, AutoModelForCausalLM
3
4tokenizer = AutoTokenizer.from_pretrained("google/gemma-7b")
5model = AutoModelForCausalLM.from_pretrained("google/gemma-7b", device_map="auto", torch_dtype=torch.bfloat16)
6
7input_text = "Write me a poem about Machine Learning."
8input_ids = tokenizer(input_text, return_tensors="pt").to("cuda")
9
10outputs = model.generate(**input_ids)
11print(tokenizer.decode(outputs[0]))bitsandbytes1# pip install bitsandbytes accelerate
2from transformers import AutoTokenizer, AutoModelForCausalLM, BitsAndBytesConfig
3
4quantization_config = BitsAndBytesConfig(load_in_8bit=True)
5
6tokenizer = AutoTokenizer.from_pretrained("google/gemma-7b")
7model = AutoModelForCausalLM.from_pretrained("google/gemma-7b", quantization_config=quantization_config)
8
9input_text = "Write me a poem about Machine Learning."
10input_ids = tokenizer(input_text, return_tensors="pt").to("cuda")
11
12outputs = model.generate(**input_ids)
13print(tokenizer.decode(outputs[0]))1# pip install bitsandbytes accelerate
2from transformers import AutoTokenizer, AutoModelForCausalLM, BitsAndBytesConfig
3
4quantization_config = BitsAndBytesConfig(load_in_4bit=True)
5
6tokenizer = AutoTokenizer.from_pretrained("google/gemma-7b")
7model = AutoModelForCausalLM.from_pretrained("google/gemma-7b", quantization_config=quantization_config)
8
9input_text = "Write me a poem about Machine Learning."
10input_ids = tokenizer(input_text, return_tensors="pt").to("cuda")
11
12outputs = model.generate(**input_ids)
13print(tokenizer.decode(outputs[0]))flash-attn in your environment pip install flash-attn1model = AutoModelForCausalLM.from_pretrained(
2 model_id,
3 torch_dtype=torch.float16,
4+ attn_implementation="flash_attention_2"
5).to(0)