Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_name = "marcosremar2/runpod_serverless_n2"
4
5model = AutoModelForCausalLM.from_pretrained(
6 model_name,
7 torch_dtype="auto",
8 device_map="auto"
9)
10tokenizer = AutoTokenizer.from_pretrained(model_name)
11
12prompt = "What is artificial intelligence?"
13messages = [
14 {"role": "system", "content": "You are a helpful assistant."},
15 {"role": "user", "content": prompt}
16]
17
18text = tokenizer.apply_chat_template(
19 messages,
20 tokenize=False,
21 add_generation_prompt=True
22)
23
24model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
25
26generated_ids = model.generate(
27 **model_inputs,
28 max_new_tokens=512
29)
30
31response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
32print(response)1Environment Variables:
2 MODEL_NAME: marcosremar2/runpod_serverless_n2
3 HF_TOKEN: YOUR_TOKEN_HERE
4 MAX_MODEL_LEN: 4096
5 TRUST_REMOTE_CODE: true
6
7GPU: RTX 4090 (24GB)
8Min Workers: 0
9Max Workers: 11from transformers import AutoModelForCausalLM, AutoTokenizer, TrainingArguments, Trainer
2
3model = AutoModelForCausalLM.from_pretrained("marcosremar2/runpod_serverless_n2")
4tokenizer = AutoTokenizer.from_pretrained("marcosremar2/runpod_serverless_n2")
5
6# Your fine-tuning code here
7# ...
8
9# Push back to your repo
10model.push_to_hub("marcosremar2/runpod_serverless_n2")
11tokenizer.push_to_hub("marcosremar2/runpod_serverless_n2")| Metric | Value |
|---|---|
| Parameters | 0.5B |
| Context Length | 32K tokens |
| VRAM Required | ~1-2GB |
| Inference Speed | 200-300 tokens/sec (RTX 4090) |