Views
No views yet
sample-10BT configuration).torch.nn.functional.scaled_dot_product_attention for memory-efficient QKV operations.torch.amp with TensorFloat-32 (TF32) support for faster matrix multiplications on Ampere architecture.4.28184.14931from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4repo_id = "bitlabsdb/gpt2-124m-transformer_model"
5
6# 1. Load Model & Tokenizer
7tokenizer = AutoTokenizer.from_pretrained(repo_id)
8model = AutoModelForCausalLM.from_pretrained(repo_id)
9
10# 2. Move to GPU
11device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
12model.to(device)
13
14# 3. Generate
15prompt = "The future of artificial intelligence is"
16inputs = tokenizer(prompt, return_tensors="pt").to(device)
17
18# Use sampling for better results
19outputs = model.generate(
20 **inputs,
21 max_new_tokens=50,
22 do_sample=True,
23 temperature=0.8,
24 top_k=40
25)
26
27print(tokenizer.decode(outputs[0], skip_special_tokens=True))