Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4# Load model and tokenizer
5model_name = "team-suzuki/Qwen3-4B-SFT-TEST2"
6tokenizer = AutoTokenizer.from_pretrained(model_name)
7model = AutoModelForCausalLM.from_pretrained(
8 model_name,
9 torch_dtype=torch.float16,
10 device_map="auto"
11)1# Prepare input
2text = "Hello, how are you?"
3inputs = tokenizer(text, return_tensors="pt")
4
5# Generate response
6with torch.no_grad():
7 outputs = model.generate(
8 **inputs,
9 max_new_tokens=100,
10 temperature=0.7,
11 do_sample=True,
12 pad_token_id=tokenizer.eos_token_id
13 )
14
15# Decode output
16response = tokenizer.decode(outputs[0], skip_special_tokens=True)
17print(response)1# For instruction-tuned models
2messages = [
3 {"role": "user", "content": "What is the capital of Japan?"}
4]
5
6# Apply chat template if available
7if hasattr(tokenizer, 'apply_chat_template'):
8 formatted_input = tokenizer.apply_chat_template(
9 messages,
10 add_generation_prompt=True,
11 return_tensors="pt"
12 )
13else:
14 formatted_input = tokenizer("User: What is the capital of Japan?\nAssistant:", return_tensors="pt")
15
16# Generate response
17outputs = model.generate(
18 formatted_input,
19 max_new_tokens=100,
20 temperature=0.7,
21 do_sample=True
22)
23
24response = tokenizer.decode(outputs[0], skip_special_tokens=True)
25print(response)1@misc{qwen3_4b_sft_test2,
2 title={Qwen3-4B-SFT-TEST2: A Fine-tuned Language Model},
3 author={[Your Name/Organization]},
4 year={2025},
5 url={https://huggingface.co/team-suzuki/Qwen3-4B-SFT-TEST2}
6}