Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3device = "cuda" # or "cpu"
4tokenizer = AutoTokenizer.from_pretrained("remodlai/lexiq-reader-3b")
5model = AutoModelForCausalLM.from_pretrained("remodlai/lexiq-reader-3b").to(device)
6
7# Create prompt
8html = "<html><body><h1>Hello, world!</h1></body></html>"
9messages = [{"role": "user", "content": f"Extract the main content from the given HTML and convert it to Markdown format.\n```html\n{html}\n```"}]
10prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
11
12# Generate
13inputs = tokenizer.encode(prompt, return_tensors="pt").to(device)
14outputs = model.generate(inputs, max_new_tokens=1024, temperature=0, do_sample=False, repetition_penalty=1.08)
15print(tokenizer.decode(outputs[0]))modal/ directory for serverless deployment with auto-scaling.1from vllm import LLM, SamplingParams
2
3llm = LLM(model="remodlai/lexiq-reader-3b", max_model_len=256000, dtype='float16')
4sampling_params = SamplingParams(temperature=0, top_k=1, max_tokens=8192)