Views
No views yet
<|im_start|> and <|im_end|> tokens).<|im_start|> user
Hva er hovedstaden i Norge?<|im_end|>
<|im_start|> assistant
Hovedstaden i Norge er Oslo. Denne byen ligger i den sørøstlige delen av landet, ved Oslofjorden. Oslo er en av de raskest voksende byene i Europa, og den er kjent for sin rike historie, kultur og moderne arkitektur. Noen populære turistattraksjoner i Oslo inkluderer Vigelandsparken, som viser mer enn 200 skulpturer laget av den berømte norske skulptøren Gustav Vigeland, og det kongelige slott, som er den offisielle residensen til Norges kongefamilie. Oslo er også hjemsted for mange museer, gallerier og teatre, samt mange restauranter og barer som tilbyr et bredt utvalg av kulinariske og kulturelle opplevelser.<|im_end|>
<|im_start|> user
Gi meg en liste over de beste stedene å besøke i hovedstaden<|im_end|>
<|im_start|> assistant
tokenizer.apply_chat_template() method:1from transformers import AutoTokenizer
2tokenizer = AutoTokenizer.from_pretrained("norallm/normistral-7b-warm-instruct")
3
4messages = [
5 {"role": "user", "content": "Hva er hovedstaden i Norge?"},
6 {"role": "assistant", "content": "Hovedstaden i Norge er Oslo. Denne byen ligger i den sørøstlige delen av landet, ved Oslofjorden. Oslo er en av de raskest voksende byene i Europa, og den er kjent for sin rike historie, kultur og moderne arkitektur. Noen populære turistattraksjoner i Oslo inkluderer Vigelandsparken, som viser mer enn 200 skulpturer laget av den berømte norske skulptøren Gustav Vigeland, og det kongelige slott, som er den offisielle residensen til Norges kongefamilie. Oslo er også hjemsted for mange museer, gallerier og teatre, samt mange restauranter og barer som tilbyr et bredt utvalg av kulinariske og kulturelle opplevelser."},
7 {"role": "user", "content": "Gi meg en liste over de beste stedene å besøke i hovedstaden"}
8]
9gen_input = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt")add_generation_prompt=True when calling apply_chat_template(). This will append <|im_start|>assistant\n to your prompt, to ensure
that the model continues with an assistant response.1from transformers import AutoModelForCausalLM
2model = AutoModelForCausalLM.from_pretrained("norallm/normistral-7b-warm-instruct", torch_dtype=torch.bfloat16)
3
4model.generate(
5 gen_input,
6 max_new_tokens=1024,
7 top_k=64, # top-k sampling
8 top_p=0.9, # nucleus sampling
9 temperature=0.3, # a low temparature to make the outputs less chaotic
10 repetition_penalty=1.0, # turn the repetition penalty off, having it on can lead to very bad outputs
11 do_sample=True, # randomly sample the outputs
12 use_cache=True # speed-up generation
13)| Name | Quant method | Bits Per Weight | Size | Max RAM/VRAM required | Use case |
|---|---|---|---|---|---|
| normistral-7b-warm-instruct.Q3_K_M.gguf | Q3_K_M | 3.89 | 3.28 GB | 5.37 GB | very small, high loss of quality |
| normistral-7b-warm-instruct.Q4_K_M.gguf | Q4_K_M | 4.83 | 4.07 GB | 6.16 GB | medium, balanced quality |
| normistral-7b-warm-instruct.Q5_K_M.gguf | Q5_K_M | 5.67 | 4.78 GB | 6.87 GB | large, very low quality loss |
| normistral-7b-warm-instruct.Q6_K.gguf | Q6_K | 6.56 | 5.54 GB | 7.63 GB | very large, extremely low quality loss |
| normistral-7b-warm-instruct.Q8_0.gguf | Q8_0 | 8.50 | 7.17 GB | 9.26 GB | very large, extremely low quality loss |
1# Base llama-ccp-python with no GPU acceleration
2pip install llama-cpp-python
3# With NVidia CUDA acceleration
4CMAKE_ARGS="-DLLAMA_CUBLAS=on" pip install llama-cpp-python
5# Or with OpenBLAS acceleration
6CMAKE_ARGS="-DLLAMA_BLAS=ON -DLLAMA_BLAS_VENDOR=OpenBLAS" pip install llama-cpp-python
7# Or with CLBLast acceleration
8CMAKE_ARGS="-DLLAMA_CLBLAST=on" pip install llama-cpp-python
9# Or with AMD ROCm GPU acceleration (Linux only)
10CMAKE_ARGS="-DLLAMA_HIPBLAS=on" pip install llama-cpp-python
11# Or with Metal GPU acceleration for macOS systems only
12CMAKE_ARGS="-DLLAMA_METAL=on" pip install llama-cpp-python
13
14# In windows, to set the variables CMAKE_ARGS in PowerShell, follow this format; eg for NVidia CUDA:
15$env:CMAKE_ARGS = "-DLLAMA_OPENBLAS=on"
16pip install llama-cpp-python1from llama_cpp import Llama
2
3# Directly from huggingface-hub (requires huggingface-hub to be installed)
4# Set gpu_layers to the number of layers to offload to GPU. Set to 0 if no GPU acceleration is available on your system.
5llm = Llama.from_pretrained(
6 repo_id="norallm/normistral-7b-warm-instruct", # HuggingFace repository containing the GGUF files.
7 filename="*Q4_K_M.gguf", # suffix of the filename containing the level of quantization.
8 n_ctx=32768, # The max sequence length to use - note that longer sequence lengths require much more resources
9 n_threads=8, # The number of CPU threads to use, tailor to your system and the resulting performance
10 n_gpu_layers=35 # The number of layers to offload to GPU, if you have GPU acceleration available
11)
12
13# Simple inference example
14output = llm(
15 """<s><|im_start|> user
16Hva kan jeg bruke einstape til?<|im_end|>
17<|im_start|> assistant
18""", # Prompt
19 max_tokens=512, # Generate up to 512 tokens
20 stop=["<|im_end|>"], # Example stop token
21 echo=True, # Whether to echo the prompt
22 temperature=0.3 # Temperature to set, for Q3_K_M, Q4_K_M, Q5_K_M, and Q6_0 it is recommended to set it relatively low.
23)
24
25# Chat Completion API
26
27llm.create_chat_completion(
28 messages = [
29 {
30 "role": "user",
31 "content": "Hva kan jeg bruke einstape til?"
32 }
33 ]
34)1@inproceedings{samuel-etal-2025-small,
2 title = "Small Languages, Big Models: {A} Study of Continual Training on Languages of {Norway}",
3 author = "Samuel, David and
4 Mikhailov, Vladislav and
5 Velldal, Erik and
6 {\O}vrelid, Lilja and
7 Charpentier, Lucas Georges Gabriel and
8 Kutuzov, Andrey and
9 Oepen, Stephan",
10 editor = "Johansson, Richard and
11 Stymne, Sara",
12 booktitle = "Proceedings of the Joint 25th Nordic Conference on Computational Linguistics and 11th Baltic Conference on Human Language Technologies (NoDaLiDa/Baltic-HLT 2025)",
13 month = mar,
14 year = "2025",
15 address = "Tallinn, Estonia",
16 publisher = "University of Tartu Library",
17 url = "https://aclanthology.org/2025.nodalida-1.61/",
18 pages = "573--608",
19 ISBN = "978-9908-53-109-0"
20}