Views
No views yet
[!NOTE] For details on how we trained Laguna, check out our release blog post and technical report.
1pip install 'vllm>=0.21.0'
2
3vllm serve \
4 --model poolside/Laguna-M.1-base \
5 --served-model-name laguna-base1from openai import OpenAI
2
3client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
4
5completion = client.completions.create(
6 model="laguna-base",
7 prompt="def fibonacci(n):\n",
8 max_tokens=128,
9 temperature=0.7,
10)
11print(completion.choices[0].text)v5.7.0 and later (huggingface/transformers#45673).[!NOTE] Laguna M.1-base is a 225B-parameter model; loading the BF16 checkpoint in Transformers requires substantial multi-GPU memory (device_map="auto"shards across available devices). For single-node serving, vLLM is recommended.
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4model_id = "poolside/Laguna-M.1-base"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7model = AutoModelForCausalLM.from_pretrained(model_id, dtype=torch.bfloat16, device_map="auto")
8
9inputs = tokenizer("def fibonacci(n):\n", return_tensors="pt").to(model.device)
10outputs = model.generate(**inputs, max_new_tokens=128, do_sample=True, temperature=0.7)
11print(tokenizer.decode(outputs[0], skip_special_tokens=True))