Views
No views yet

pip install -r requirements.txtpip install torch>=2.0.0 transformers>=4.36.0 accelerate sentencepiece1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3# Load model and tokenizer
4model = AutoModelForCausalLM.from_pretrained(
5 "Kirim-ai/Kirim-V1-base",
6 torch_dtype="auto",
7 device_map="auto",
8 trust_remote_code=True
9)
10
11tokenizer = AutoTokenizer.from_pretrained(
12 "Kirim-ai/Kirim-V1-base",
13 trust_remote_code=True
14)
15
16# Prepare conversation
17messages = [
18 {"role": "system", "content": "You are Kirim, a helpful AI assistant proficient in both Chinese and English."},
19 {"role": "user", "content": "介绍一下深度学习的基本原理"}
20]
21
22# Apply chat template
23text = tokenizer.apply_chat_template(
24 messages,
25 tokenize=False,
26 add_generation_prompt=True
27)
28
29# Tokenize and generate
30inputs = tokenizer([text], return_tensors="pt").to(model.device)
31
32outputs = model.generate(
33 **inputs,
34 max_new_tokens=2048,
35 temperature=0.7,
36 top_p=0.9,
37 top_k=50,
38 repetition_penalty=1.1,
39 do_sample=True
40)
41
42# Decode response
43response = tokenizer.decode(outputs[0][inputs['input_ids'].shape[1]:], skip_special_tokens=True)
44print(response)1# Interactive chat mode
2python inference.py --model_path Kirim-ai/Kirim-V1-base --chat
3
4# Single prompt generation
5python inference.py --prompt "Explain quantum computing in simple terms"
6
7# With 4-bit quantization (requires 12GB+ VRAM)
8python inference.py --load_in_4bit --chat
9
10# With 8-bit quantization (requires 16GB+ VRAM)
11python inference.py --load_in_8bit --chat1model = AutoModelForCausalLM.from_pretrained(
2 "Kirim-ai/Kirim-V1-base",
3 torch_dtype=torch.bfloat16,
4 device_map="auto"
5)1model = AutoModelForCausalLM.from_pretrained(
2 "Kirim-ai/Kirim-V1-base",
3 load_in_8bit=True,
4 device_map="auto"
5)1model = AutoModelForCausalLM.from_pretrained(
2 "Kirim-ai/Kirim-V1-base",
3 load_in_4bit=True,
4 device_map="auto"
5)<|begin_of_text|><|system|>
{system_message}
<|user|>
{user_message}
<|assistant|>
{assistant_response}1messages = [
2 {"role": "system", "content": "你是一个专业的Python编程助手,请用中文回答问题。"},
3 {"role": "user", "content": "如何优化这段代码?"}
4]| Parameter | Value |
|---|---|
| Model Type | Causal Language Model |
| Architecture | Decoder-only Transformer |
| Hidden Size | 4096 |
| Layers | 32 |
| Attention Heads | 32 |
| KV Heads | 8 (Grouped Query Attention) |
| Vocabulary Size | 102,400 |
| Context Length | 32,768 tokens |
| Activation Function | SiLU |
| Position Encoding | RoPE with YaRN scaling (factor: 2.0) |
| Normalization | RMSNorm (eps: 1e-6) |
| Precision | BFloat16 |
| Total Parameters | ~13B |
1@misc{kirim2025v1base,
2 title={Kirim-V1-Base: A High-Performance Bilingual Language Model},
3 author={Kirim AI Team},
4 year={2025},
5 url={https://huggingface.co/Kirim-ai/Kirim-V1}
6}