Views
No views yet
| Metric | Score | Details |
|---|---|---|
| Token F1 Score | 92.3% | Semantic similarity measurement |
| BLEU Score | 0.847 | Response quality assessment |
| Average Latency | 2.0s | End-to-end response time |
| Model Size | 200MB | LoRA adapters only |
1Base Model: meta-llama/Llama-3.1-8B-Instruct
2Method: LoRA (Low-Rank Adaptation)
3LoRA Rank: 32
4LoRA Alpha: 64
5Target Modules: [q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj, lm_head]
6Training Epochs: 3
7Learning Rate: 1e-4
8Batch Size: 16 (effective)
9Optimizer: AdamW with cosine scheduling
10Precision: BFloat16Final Training Loss: 1.37
Convergence: Achieved after ~1,100 steps
Training Time: ~6 hours on A100 GPU
Memory Usage: ~45GB during training1from transformers import AutoTokenizer, AutoModelForCausalLM
2from peft import PeftModel
3import torch
4
5# Load base model
6base_model = AutoModelForCausalLM.from_pretrained(
7 "meta-llama/Llama-3.1-8B-Instruct",
8 torch_dtype=torch.bfloat16,
9 device_map="auto"
10)
11
12# Load LoRA adapters
13model = PeftModel.from_pretrained(
14 base_model,
15 "chinmays18/llm-knowledge-assistant-8b"
16)
17
18# Load tokenizer
19tokenizer = AutoTokenizer.from_pretrained(
20 "chinmays18/llm-knowledge-assistant-8b"
21)
22
23def generate_expert_response(question):
24 """Generate expert-level response to technical questions."""
25 prompt = f"""### Instruction:
26Answer the following question based on your technical knowledge. Provide accurate, comprehensive explanations.
27
28### Input:
29{question}
30
31### Response:
32"""
33
34 inputs = tokenizer(prompt, return_tensors="pt")
35 with torch.no_grad():
36 outputs = model.generate(
37 **inputs,
38 max_new_tokens=100,
39 temperature=0.1,
40 do_sample=False,
41 use_cache=True,
42 pad_token_id=tokenizer.pad_token_id,
43 eos_token_id=tokenizer.eos_token_id
44 )
45
46 response = tokenizer.decode(
47 outputs[0][inputs['input_ids'].shape[1]:],
48 skip_special_tokens=True
49 )
50 return response.strip()
51
52# Example usage
53examples = [
54 "What is machine learning?",
55 "Explain the difference between supervised and unsupervised learning.",
56 "What is overfitting and how can it be prevented?",
57 "How do convolutional neural networks work?"
58]
59
60for question in examples:
61 response = generate_expert_response(question)
62 print(f"Q: {question}")
63 print(f"A: {response}\n")1from sentence_transformers import SentenceTransformer
2import faiss
3
4class RAGKnowledgeAssistant:
5 def __init__(self, model_path="chinmays18/llm-knowledge-assistant-8b"):
6 # Load the fine-tuned model
7 self.load_model(model_path)
8
9 # Initialize retrieval components
10 self.embedder = SentenceTransformer('sentence-transformers/all-MiniLM-L6-v2')
11 self.knowledge_base = self.load_faiss_index()
12
13 def query(self, question, top_k=3):
14 """Complete RAG pipeline query."""
15 # Retrieve relevant documents
16 relevant_docs = self.retrieve_documents(question, top_k)
17
18 # Generate response with context
19 response = self.generate_with_context(question, relevant_docs)
20
21 return {
22 'answer': response,
23 'sources': relevant_docs,
24 'confidence': self.calculate_confidence(response)
25 }
26
27# Usage
28assistant = RAGKnowledgeAssistant()
29result = assistant.query("What is deep learning?")
30print(f"Answer: {result['answer']}")1FROM nvidia/cuda:11.8-runtime-ubuntu20.04
2
3# Install dependencies
4RUN pip install transformers peft torch
5
6# Load model
7COPY model_loading_script.py /app/
8RUN python /app/model_loading_script.py
9
10# API server
11COPY api_server.py /app/
12EXPOSE 5000
13CMD ["python", "/app/api_server.py"]| Model | Accuracy | Latency | Model Size |
|---|---|---|---|
| This Model | 85+% | 2.0s | 200MB |
| GPT-3.5-turbo | 85.3% | 1.5s | N/A (API) |
| Base Llama-3.1-8B | 78.2% | 2.5s | 15GB |
| Fine-tuned BERT-Large | 82.1% | 0.3s | 1.3GB |
/ask What is containerization?1@misc{llm-knowledge-assistant-8b,
2 title={LLM Knowledge Assistant: Fine-tuned Llama-3.1-8B for Domain-Specific Q&A},
3 author={Your Name},
4 year={2025},
5 publisher={Hugging Face},
6 url={https://huggingface.co/chinmays18/llm-knowledge-assistant-8b}
7}