Views
No views yet
[!Note] This repository contains model weights and configuration files for the Legion Coder 8M model in the Hugging Face Transformers format.These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, KTransformers, etc.
1# Download and run locally
2git clone https://huggingface.co/pnny13/legion-coder-8m
3cd legion-coder-8m
4pip install -r requirements.txt
5streamlit run app.pyapp.py and requirements.txt1# Download and run locally
2git clone https://huggingface.co/pnny13/legion-coder-8m
3cd legion-coder-8m
4pip install -r requirements_gradio.txt
5python gradio_app.pygradio_app.py and requirements_gradio.txt1import sagemaker
2from sagemaker.huggingface import HuggingFaceModel
3
4huggingface_model = HuggingFaceModel(
5 model_data="pnny13/legion-coder-8m",
6 transformers_version="4.36.0",
7 pytorch_version="2.1.0",
8 py_version="py310",
9 role="YOUR_SAGEMAKER_ROLE",
10)
11
12predictor = huggingface_model.deploy(
13 initial_instance_count=1,
14 instance_type="ml.m5.large",
15 endpoint_name="legion-coder-8m"
16)| Legion Coder 8M | TinyLlama-1.1B | Qwen2.5-0.5B | CodeLlama-7B | Phi-2 | |
|---|---|---|---|---|---|
| Efficiency Metrics | |||||
| Model Size | ~170MB | ~2.2GB | ~1.0GB | ~13GB | ~5.3GB |
| Parameters | 44M | 1.1B | 500M | 7B | 2.7B |
| CPU Compatible | Yes | No | Limited | No | No |
| Efficiency Score | 9.5/10 | 6.0/10 | 7.0/10 | 5.0/10 | 6.5/10 |
1import sagemaker
2from sagemaker.huggingface import HuggingFaceModel
3
4# Initialize SageMaker session
5sess = sagemaker.Session()
6
7# Create Hugging Face Model
8huggingface_model = HuggingFaceModel(
9 model_data="pnny13/legion-coder-8m",
10 transformers_version="4.36.0",
11 pytorch_version="2.1.0",
12 py_version="py310",
13 role="arn:aws:iam::YOUR_ACCOUNT_ID:role/YOUR_SAGEMAKER_ROLE",
14 sagemaker_session=sess,
15)
16
17# Deploy to SageMaker
18predictor = huggingface_model.deploy(
19 initial_instance_count=1,
20 instance_type="ml.m5.large",
21 endpoint_name="legion-coder-8m-endpoint"
22)
23
24# Test the endpoint
25result = predictor.predict({
26 "inputs": "Write a Python function to calculate fibonacci numbers:",
27 "parameters": {
28 "temperature": 0.8,
29 "max_new_tokens": 200
30 }
31})
32
33print(result)1from vllm import LLM, SamplingParams
2
3# Load model with vLLM
4llm = LLM(model="pnny13/legion-coder-8m")
5
6# Set sampling parameters
7sampling_params = SamplingParams(
8 temperature=0.8,
9 top_p=0.95,
10 max_tokens=200
11)
12
13# Generate code
14prompt = "Write a Python function to calculate fibonacci numbers:"
15outputs = llm.generate(prompt, sampling_params)
16print(outputs[0].outputs[0].text)1import sglang as sgl
2
3# Define prompt template
4@sgl.function
5def code_gen(s, prompt):
6 s += sgl.system("You are a helpful coding assistant.")
7 s += sgl.user(prompt)
8 s += sgl.assistant(sgl.gen("code", max_tokens=200))
9
10# Run inference
11result = code_gen.run(
12 prompt="Write a Python function to calculate fibonacci numbers:",
13 temperature=0.8
14)
15print(result["code"])