Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("abhishekchohan/Qwen3-8B-AWQ", device_map="auto")
4tokenizer = AutoTokenizer.from_pretrained("abhishekchohan/Qwen3-8B-AWQ")
5
6messages = [{"role": "user", "content": "Explain quantum computing."}]
7text = tokenizer.apply_chat_template(messages, tokenize=False)
8inputs = tokenizer(text, return_tensors="pt").to(model.device)1vllm serve abhishekchohan/Qwen3-8B-AWQ \
2 --chat-template templates/chat_template.jinja \
3 --enable-expert-parallel \
4 --tensor-parallel-size 4@misc{qwen3,
title = {Qwen3 Technical Report},
author = {Qwen Team},
year = {2025},
url = {https://github.com/QwenLM/Qwen3}
}