Views
No views yet
float16.transformers,Built by eulogik
| Build | Repo | Size | Use |
|---|---|---|---|
| MLX 4-bit (edge / Apple Silicon) | eulogik/Bharat-Tiny-LLM | ~880 MB | Recommended for Mac / on-device |
| GGUF Q4_K_M (llama.cpp, Android / Pi / CPU) | eulogik/Bharat-Tiny-LLM-GGUF | ~1.06 GB | Cross-platform, llama.cpp |
| PyTorch fp16 (this repo) | eulogik/Bharat-Tiny-LLM-fused | ~3.3 GB | Server / fine-tuning base |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("eulogik/Bharat-Tiny-LLM-fused")
4tokenizer = AutoTokenizer.from_pretrained("eulogik/Bharat-Tiny-LLM-fused")
5
6messages = [{"role": "user", "content": "Chai peete hain?"}]
7prompt = tokenizer.apply_chat_template(messages, add_generation_prompt=True)
8inputs = tokenizer(prompt, return_tensors="pt")
9out = model.generate(
10 **inputs,
11 max_new_tokens=256,
12 temperature=0.3,
13 top_p=0.85,
14 repetition_penalty=1.25,
15 no_repeat_ngram_size=3,
16 do_sample=True,
17)
18print(tokenizer.decode(out[0][inputs.input_ids.shape[1]:], skip_special_tokens=True))⚠️ Generation config matters. The base Qwen2.5-1.5B emits garbled out-of-script tokens at high temperature. Always usetemperature ≈ 0.3+repetition_penalty ≥ 1.25+no_repeat_ngram_size = 3. Thebharat-tiny-llmPyPI package applies these for you.