Views
No views yet

codellama/CodeLlama-34b-hf model fine-tuned using QLoRA (4-bit precision) on 13B tokens of csharp evolved Q&AAutoAWQ library.1base_model: codellama/CodeLlama-34b-hf
2base_model_config: codellama/CodeLlama-34b-hf
3model_type: LlamaForCausalLM
4tokenizer_type: CodeLlamaTokenizer
5is_llama_derived_model: true
6hub_model_id: "Safurai/Evol-csharp-v1"
7
8load_in_8bit: false
9load_in_4bit: true
10strict: false
11
12datasets:
13 - path: Safurai/EvolInstruct-csharp-16k-13B-Alpaca
14 type: alpaca
15dataset_prepared_path: last_run_prepared
16val_set_size: 0.01
17output_dir: ./qlora-out
18
19sequence_len: 4096
20sample_packing: true
21pad_to_sequence_len: true
22
23adapter: lora
24lora_model_dir:
25lora_r: 32
26lora_alpha: 16
27lora_dropout: 0.05
28lora_target_linear: true
29lora_fan_in_fan_out:
30
31wandb_project: codellama-csharp
32wandb_entity:
33wandb_watch:
34wandb_run_id:
35wandb_log_model:
36
37gradient_accumulation_steps: 4
38micro_batch_size: 2
39num_epochs: 3
40optimizer: adamw_bnb_8bit
41lr_scheduler: cosine
42learning_rate: 0.0003
43
44train_on_inputs: false
45group_by_length: false
46bf16: true
47fp16: false
48tf32: false
49
50gradient_checkpointing: true
51early_stopping_patience:
52resume_from_checkpoint:
53local_rank:
54logging_steps: 1
55xformers_attention:
56flash_attention: true
57
58warmup_steps: 40
59eval_steps: 40
60save_steps:
61debug:
62deepspeed:
63weight_decay: 0.0
64fsdp:
65fsdp_config:
66special_tokens:
67 bos_token: "<s>"
68 eos_token: "</s>"
69 unk_token: "<unk>"

1from awq import AutoAWQForCausalLM
2from transformers import AutoTokenizer, TextStreamer
3
4quant_path = "Safurai/Safurai-Csharp-34B-AWQ"
5
6# Load model
7model = AutoAWQForCausalLM.from_quantized(quant_path, fuse_layers=True)
8tokenizer = AutoTokenizer.from_pretrained(quant_path, trust_remote_code=True)
9streamer = TextStreamer(tokenizer, skip_special_tokens=True)
10
11# Convert prompt to tokens
12prompt_template = """\
13A chat between a developer and an AI assistant. The assistant is an expert csharp programmer that can give useful and complete code responses.
14
15USER: {prompt}
16ASSISTANT:"""
17
18tokens = tokenizer(
19 prompt_template.format(prompt="How are you today?"),
20 return_tensors='pt'
21).input_ids.cuda()
22
23# Generate output
24generation_output = model.generate(
25 tokens,
26 streamer=streamer,
27 max_new_tokens=1024
28)