Views
No views yet
1import transformers
2import torch
3
4model_name = "OpenLLM-France/Claire-7B-FR-Instruct-0.1"
5
6tokenizer = transformers.AutoTokenizer.from_pretrained(model_name)
7model = transformers.AutoModelForCausalLM.from_pretrained(model_name,
8 device_map="auto",
9 torch_dtype=torch.bfloat16,
10 load_in_4bit=True # For efficient inference, if supported by the GPU card
11)
12
13pipeline = transformers.pipeline("text-generation", model=model, tokenizer=tokenizer)
14generation_kwargs = dict(
15 num_return_sequences=1, # Number of variants to generate.
16 return_full_text= False, # Do not include the prompt in the generated text.
17 max_new_tokens=200, # Maximum length for the output text.
18 do_sample=True, top_k=10, temperature=1.0, # Sampling parameters.
19 pad_token_id=tokenizer.eos_token_id, # Just to avoid a harmless warning.
20)
21
22prompt = "Utilisateur: {}\n\nAssistant: ".format(
23 "Qui était le président Français en 1995 ?"
24)
25
26completions = pipeline(prompt, **generation_kwargs)
27for completion in completions:
28 print(prompt + " […]" + completion['generated_text'])gpt-3.5-turbo.lora_rank: 8
lora_alpha: 16
lora_dropout: 0.05
lora_bias: none
learning_rate: 0.0001
lora_target_modules: ['query_key_value', 'dense_h_to_4h', 'dense_4h_to_h', 'dense'] │
lora_task_type: CAUSAL_LM
num_train_epochs: 1