Views
No views yet
1pip install transformers torch safetensors
2pip install flash-attn mamba-ssm causal-conv1d --no-build-isolation1import torch
2from transformers import AutoTokenizer, AutoModelForCausalLM
3
4tokenizer = AutoTokenizer.from_pretrained("QwerkyAI/Qwick-3B-Instruct")
5model = AutoModelForCausalLM.from_pretrained(
6 "QwerkyAI/Qwick-3B-Instruct",
7 torch_dtype=torch.bfloat16,
8 device_map="auto",
9 trust_remote_code=True
10)
11
12inputs = tokenizer("Hello, how are you?", return_tensors="pt").to("cuda")
13outputs = model.generate(**inputs, max_new_tokens=50)
14print(tokenizer.decode(outputs[0]))config.json - Model configuration with auto_mapmodeling_qwerky_llama_mamba_hybrid.py - Custom modeling classconfiguration_qwerky_llama_mamba_hybrid.py - Custom configuration classmodel.safetensors - Model weights