Views
No views yet
benchmark_eval.py)1import time
2import torch
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5model_path = "Neura-Tech-AI/Neuron-V1-3B-Instruct"
6
7print("🎯 Initializing Project Neuron Evaluation Suite...")
8tokenizer = AutoTokenizer.from_pretrained(model_path)
9model = AutoModelForCausalLM.from_pretrained(model_path, torch_dtype=torch.float16).to("cuda")
10
11eval_prompts = [
12 "Tell me about Project Neuron in short. What is its scale?",
13 "Explain quantum computing in simple Hindi lyrics.",
14 "Write a secure python API routing block for model inference."
15]
16
17def run_performance_test(prompt):
18 messages = [
19 {"role": "system", "content": "You are Neuron, an advanced AI system developed by Neura Tech AI."},
20 {"role": "user", "content": prompt}
21 ]
22 text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
23 inputs = tokenizer([text], return_tensors="pt").to("cuda")
24 input_len = inputs.input_ids.shape[1]
25
26 start_time = time.time()
27 with torch.no_grad():
28 outputs = model.generate(
29 **inputs,
30 max_new_tokens=150,
31 temperature=0.1,
32 do_sample=False,
33 pad_token_id=tokenizer.eos_token_id
34 )
35 latency = time.time() - start_time
36
37 generated_tokens = outputs[0][input_len:]
38 token_count = len(generated_tokens)
39 tokens_per_second = token_count / latency
40
41 response = tokenizer.decode(generated_tokens, skip_special_tokens=True).strip()
42 return latency, tokens_per_second, response
43
44print("\n--- Running Quantitative Evaluation Matrix ---")
45for i, prompt in enumerate(eval_prompts, 1):
46 lat, tps, resp = run_performance_test(prompt)
47 print(f"\n📊 Test Case #{i}: '{prompt}'")
48 print(f"⏱️ Latency: {lat:.2f}s | ⚡ Speed: {tps:.2f} tokens/sec")
49 print(f"🤖 Output:\n{resp}\n" + "-"*40)1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4model_id = "Neura-Tech-AI/Neuron-V1-3B-Instruct"
5
6# Load Standalone Tokenizer & Fused Core Weights
7tokenizer = AutoTokenizer.from_pretrained(model_id)
8model = AutoModelForCausalLM.from_pretrained(
9 model_id,
10 torch_dtype=torch.float16,
11 device_map="auto"
12)
13
14# Standard Query Payload
15messages = [
16 {"role": "system", "content": "You are Project Neuron, an advanced AI system developed by Neura Tech AI."},
17 {"role": "user", "content": "tu kon hai be."}
18]
19
20# Apply Native Tokenization Layout
21text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
22inputs = tokenizer([text], return_tensors="pt").to("cuda")
23
24# Run Stable Token Generation
25outputs = model.generate(
26 **inputs,
27 max_new_tokens=100,
28 temperature=0.3,
29 do_sample=True,
30 top_p=0.9,
31 pad_token_id=tokenizer.eos_token_id
32)
33
34# Input-Length Slicing for explicit assistant reply isolation
35input_len = inputs.input_ids.shape[1]
36clean_reply = tokenizer.decode(outputs[0][input_len:], skip_special_tokens=True).strip()
37
38print(f"🤖 Project Neuron Reply:\n{clean_reply}")
39