Views
No views yet
1models:
2 - model: CEIA-UFG/Gemma-3-Gaia-PT-BR-4b-it
3 parameters:
4 density: 0.6
5 weight: 0.34
6
7 - model: soob3123/Veiled-Calla-4B
8 parameters:
9 density: 0.6
10 weight: 0.33
11
12 - model: soob3123/amoral-gemma3-4B-v2-qat
13 parameters:
14 density: 0.6
15 weight: 0.33
16
17merge_method: dare_ties
18base_model: unsloth/gemma-3-4b-it-qat
19
20parameters:
21 normalize: true
22 int8_mask: true
23
24dtype: bfloat16pip install -qU transformers accelerate torch1from transformers import AutoTokenizer, AutoModelForCausalLM
2import transformers
3import torch
4
5# Model configuration
6model_name = "rodrigomt/gama-4b"
7
8# Load tokenizer and model
9tokenizer = AutoTokenizer.from_pretrained(model_name)
10model = AutoModelForCausalLM.from_pretrained(
11 model_name,
12 torch_dtype=torch.bfloat16,
13 device_map="auto",
14 trust_remote_code=True
15)
16
17# Example in Portuguese
18messages_pt = [
19 {"role": "user", "content": "What is a large language model?"}
20]
21
22# Example in English
23messages_en = [
24 {"role": "user", "content": "What is a large language model?"}
25]
26
27# Apply chat template
28prompt = tokenizer.apply_chat_template(
29 messages_pt,
30 tokenize=False,
31 add_generation_prompt=True
32)
33
34# Pipeline configuration
35pipeline = transformers.pipeline(
36 "text-generation",
37 model=model,
38 tokenizer=tokenizer,
39 torch_dtype=torch.bfloat16,
40 device_map="auto",
41)
42
43# Text generation
44outputs = pipeline(
45 prompt,
46 max_new_tokens=256,
47 do_sample=True,
48 temperature=0.7,
49 top_k=50,
50 top_p=0.95,
51 repetition_penalty=1.1
52)
53
54print(outputs[0]["generated_text"])1# Conversation switching languages
2conversation = [
3 {"role": "user", "content": "Hello! How are you?"},
4 {"role": "assistant", "content": "Hello! I'm doing well, thank you for asking. How can I help you today?"},
5 {"role": "user", "content": "Can you switch to English?"},
6 {"role": "assistant", "content": "Of course! I can communicate in both Portuguese and English. How can I help you?"}
7]
8
9prompt = tokenizer.apply_chat_template(conversation, tokenize=False, add_generation_prompt=True)
10outputs = pipeline(prompt, max_new_tokens=128, temperature=0.7)
11print(outputs[0]["generated_text"])1# For more granular control over generation
2def generate_response(prompt_text, max_tokens=256, temperature=0.7):
3 inputs = tokenizer.encode(prompt_text, return_tensors="pt")
4 attention_mask = inputs.ne(tokenizer.pad_token_id)
5
6 with torch.no_grad():
7 outputs = model.generate(
8 inputs,
9 attention_mask=attention_mask,
10 max_new_tokens=max_tokens,
11 do_sample=True,
12 temperature=temperature,
13 top_k=50,
14 top_p=0.95,
15 repetition_penalty=1.1,
16 pad_token_id=tokenizer.eos_token_id,
17 eos_token_id=tokenizer.eos_token_id
18 )
19
20 response = tokenizer.decode(outputs[0], skip_special_tokens=True)
21 return response
22
23# Using the function
24response = generate_response("Explain machine learning in simple terms:")
25print(response)1# More creative responses
2outputs = pipeline(prompt, temperature=0.9, top_p=0.95)
3
4# More conservative responses
5outputs = pipeline(prompt, temperature=0.3, top_k=30)1# Reduce repetitions
2outputs = pipeline(prompt, repetition_penalty=1.2, no_repeat_ngram_size=3)