Views
No views yet
1from unsloth import FastLanguageModel
2import torch
3
4model, tokenizer = FastLanguageModel.from_pretrained(
5 model_name = "Chat2Find/Chat2Find-CPT",
6 max_seq_length = 2048,
7 load_in_4bit = True,
8)
9FastLanguageModel.for_inference(model)
10
11prompt = "ශ්රී ලංකාව ගැන කෙටි විස්තරයක්:"
12
13inputs = tokenizer(
14 text=[prompt],
15 return_tensors="pt"
16).to("cuda")
17
18outputs = model.generate(**inputs, max_new_tokens=256)
19# Decode the generated text
20response = tokenizer.decode(outputs[0], skip_special_tokens=True)
21print(response)1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_name = "Chat2Find/Chat2Find-CPT"
4tokenizer = AutoTokenizer.from_pretrained(model_name)
5model = AutoModelForCausalLM.from_pretrained(model_name, device_map="auto")
6
7# Note: The model is a merged 16-bit weight set.
8# You can load it in 4-bit/8-bit using BitsAndBytes.1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_name = "Chat2Find/Chat2Find-CPT"
4tokenizer = AutoTokenizer.from_pretrained(model_name)
5
6# Force the model to load into CPU RAM
7model = AutoModelForCausalLM.from_pretrained(
8 model_name,
9 device_map="cpu",
10 torch_dtype="auto" # Loads in bfloat16 to save RAM
11)
12
13prompt = "ශ්රී ලංකාව ගැන කෙටි විස්තරයක්:"
14inputs = tokenizer(text=[prompt], return_tensors="pt").to("cpu")
15
16outputs = model.generate(**inputs, max_new_tokens=128)
17response = tokenizer.decode(outputs[0], skip_special_tokens=True)
18print(response)