Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model_name = "Kushalkhemka/OSS-20B-FFT-NUMINA-COT"
5
6# Load model and tokenizer
7tokenizer = AutoTokenizer.from_pretrained(model_name)
8model = AutoModelForCausalLM.from_pretrained(
9 model_name,
10 torch_dtype=torch.bfloat16,
11 device_map="auto",
12 trust_remote_code=True
13)
14
15# Generate text
16prompt = "Explain quantum computing in simple terms:"
17inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
18
19with torch.no_grad():
20 outputs = model.generate(
21 **inputs,
22 max_new_tokens=512,
23 temperature=0.7,
24 top_p=0.9,
25 do_sample=True
26 )
27
28response = tokenizer.decode(outputs[0], skip_special_tokens=True)
29print(response)pip install vllm1from vllm import LLM, SamplingParams
2
3# Initialize the model
4llm = LLM(
5 model="Kushalkhemka/OSS-20B-FFT-NUMINA-COT",
6 tensor_parallel_size=1, # Increase for multi-GPU
7 dtype="bfloat16",
8 trust_remote_code=True
9)
10
11# Set sampling parameters
12sampling_params = SamplingParams(
13 temperature=0.7,
14 top_p=0.9,
15 max_tokens=512
16)
17
18# Generate
19prompts = [
20 "Explain quantum computing:",
21 "What is machine learning?",
22]
23
24outputs = llm.generate(prompts, sampling_params)
25
26for output in outputs:
27 prompt = output.prompt
28 generated_text = output.outputs[0].text
29 print(f"Prompt: {prompt!r}, Generated text: {generated_text!r}")1from vllm import LLM, SamplingParams
2
3# Use multiple GPUs
4llm = LLM(
5 model="Kushalkhemka/OSS-20B-FFT-NUMINA-COT",
6 tensor_parallel_size=4, # Use 4 GPUs
7 dtype="bfloat16",
8 trust_remote_code=True
9)
10
11sampling_params = SamplingParams(temperature=0.7, top_p=0.9, max_tokens=512)
12outputs = llm.generate(["Your prompt here"], sampling_params)1python -m vllm.entrypoints.openai.api_server \
2 --model Kushalkhemka/OSS-20B-FFT-NUMINA-COT \
3 --tensor-parallel-size 1 \
4 --dtype bfloat16 \
5 --trust-remote-code1from openai import OpenAI
2
3client = OpenAI(
4 base_url="http://localhost:8000/v1",
5 api_key="dummy"
6)
7
8completion = client.chat.completions.create(
9 model="Kushalkhemka/OSS-20B-FFT-NUMINA-COT",
10 messages=[
11 {"role": "user", "content": "Explain quantum computing:"}
12 ],
13 temperature=0.7,
14 max_tokens=512
15)
16
17print(completion.choices[0].message.content)tensor_parallel_size to distribute the model across multiple GPUs1from transformers import AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("Kushalkhemka/OSS-20B-FFT-NUMINA-COT")
4
5messages = [
6 {"role": "user", "content": "What is Python?"}
7]
8
9# Apply chat template
10formatted_prompt = tokenizer.apply_chat_template(
11 messages,
12 tokenize=False,
13 add_generation_prompt=True
14)
15
16print(formatted_prompt)<|startoftext|> (199998): Beginning of text<|endoftext|> (199999): End of text / Padding<|return|> (200002): Return/EOS token<|call|> (200012): Function call token<|endofprompt|> (200018): End of prompt1@misc{oss-20b-fft-numina-cot,
2 author = {Kushalkhemka},
3 title = {OSS-20B-FFT-NUMINA-COT: Fine-tuned GPT-OSS-20B with Numina Chain-of-Thought},
4 year = {2024},
5 publisher = {Hugging Face},
6 howpublished = {\url{https://huggingface.co/Kushalkhemka/OSS-20B-FFT-NUMINA-COT}}
7}