Views
No views yet
1
2def init_model():
3 model = AutoModelForCausalLM.from_pretrained(
4 "EnjoyCodeX/MedLang-13B/MedLang-13B",
5 torch_dtype=torch.float16,
6 device_map="auto",
7 trust_remote_code=True
8 )
9 model.generation_config = GenerationConfig.from_pretrained(
10 "EnjoyCodeX/MedLang-13B/MedLang-13B",
11 )
12 tokenizer = AutoTokenizer.from_pretrained(
13 "EnjoyCodeX/MedLang-13B/MedLang-13B",
14 use_fast=False,
15 trust_remote_code=True
16 )
17 return model, tokenizer1[object Object][object Object] torch
2[object Object][object Object] transformers [object Object] AutoModelForCausalLM, AutoTokenizer
3[object Object][object Object] transformers.generation.utils [object Object] GenerationConfig
4[object Object]tokenizer = AutoTokenizer.from_pretrained([object Object], use_fast=[object Object], trust_remote_code=[object Object])
5[object Object]model = AutoModelForCausalLM.from_pretrained([object Object], device_map=[object Object], torch_dtype=torch.float16, trust_remote_code=[object Object])
6[object Object]model.generation_config = GenerationConfig.from_pretrained([object Object])
7[object Object]messages = []
8[object Object]messages.append({[object Object]: [object Object], [object Object]: [object Object]})
9[object Object]response = model.chat(tokenizer, messages)
10[object Object][object Object](response)




Precision | GPU Mem (GB) |
|---|---|
| bf16 / fp16 | 26.0 |
| int8 | 15.8 |
| int4 | 9.7 |