Views
No views yet
1dataset = load_dataset("wikipedia", "20220301.en")
2dataset = dataset['train'].select(range(int(1e5)))1import torch
2from replace_hf import replace_linear_in_hf
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5
6def quick_test(model, tokenizer, prompt: str):
7 # Encode the inputs
8 inputs = tokenizer.encode(prompt, return_tensors="pt")
9
10 # Generate outputs
11 outputs = model.generate(inputs, max_length=64)
12
13 # Decode and print the outputs
14 print(tokenizer.decode(outputs[0]))
15
16
17torch.set_default_device("cuda")
18
19tokenizer = AutoTokenizer.from_pretrained("microsoft/phi-1_5", trust_remote_code=True)
20model = AutoModelForCausalLM.from_pretrained("Mrw33554432/bitLinear-phi-1.5", trust_remote_code=True, torch_dtype=torch.float16)
21
22print(model)
23# Replace Linear layers with BitLinear
24replace_linear_in_hf(model, keep_param=True)
25print(model)
26
27quick_test(model, tokenizer, prompt="Tom is the")