Views
No views yet
{
"code": "...",
"explanation": "...",
"confidence": 0.84,
"relevancy_score": 0.82,
"hallucination": false
}
1This enables:
2
3-Easy API integration
4-Automated evaluation
5-Better interpretability1!pip -q install -U transformers peft accelerate huggingface_hub safetensors
2!pip install --upgrade torchao
3
4from google.colab import userdata
5HF_TOKEN = userdata.get('HF_TOKEN')
6
7model = "girish00/ConicAI_LLM_model"
8prompt = input("Enter your prompt: ")
9
10from huggingface_hub import login, snapshot_download
11login(token=HF_TOKEN)
12
13repo = snapshot_download(model, token=HF_TOKEN)
14
15import sys, os
16sys.path.append(repo)
17
18from infer_local import build_instruction_prompt, build_structured_result
19from peft import PeftConfig, PeftModel
20from transformers import AutoTokenizer, AutoModelForCausalLM
21import torch, time, json
22
23cfg = PeftConfig.from_pretrained(repo)
24base = cfg.base_model_name_or_path
25
26tokenizer = AutoTokenizer.from_pretrained(base)
27
28base_model = AutoModelForCausalLM.from_pretrained(
29 base,
30 torch_dtype=torch.float16 if torch.cuda.is_available() else torch.float32,
31 device_map="auto"
32)
33
34llm = PeftModel.from_pretrained(base_model, repo)
35llm.eval()
36
37inputs = tokenizer(build_instruction_prompt(prompt), return_tensors="pt").to(llm.device)
38
39start = time.perf_counter()
40
41with torch.no_grad():
42 out = llm.generate(
43 **inputs,
44 max_new_tokens=320,
45 output_scores=True,
46 return_dict_in_generate=True,
47 do_sample=False,
48 pad_token_id=tokenizer.eos_token_id
49 )
50
51latency = int((time.perf_counter() - start) * 1000)
52
53gen_ids = out.sequences[0][inputs["input_ids"].shape[1]:].tolist()
54text = tokenizer.decode(gen_ids, skip_special_tokens=True)
55
56conf = []
57for tid, score in zip(gen_ids, out.scores):
58 probs = torch.softmax(score[0], dim=-1)
59 conf.append(float(probs[tid].item()))
60
61print(json.dumps(
62 build_structured_result(
63 prompt,
64 text,
65 latency,
66 tokenizer=tokenizer,
67 generated_ids=gen_ids,
68 token_confidences=conf
69 ),
70 indent=2
71))
| Parameter | Value |
|---|---|
| Epochs | 1–3 |
| Batch Size | 2 |
| Learning Rate | 2e-4 |
| Max Sequence Length | 512 |
| LoRA Rank (r) | 8 |
| LoRA Alpha | 16 |
| LoRA Dropout | 0.05 |
1max_new_tokens = 200
2temperature = 0.2
3top_p = 0.9
4do_sample = True1@misc{conicai_llm,
2 author = {Girish},
3 title = {ConicAI Coding LLM},
4 year = {2026},
5 publisher = {Hugging Face}
6}