Views
No views yet
quantized_simple/onnx/prefill/model.onnx - Context prefilltoken_gen/model.onnx - Token generationquantized_onnx/qnn_compiled/1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("marcusmi4n/abeja-qwen2.5-7b-japanese-qnn", subfolder="quantized_simple")
4tokenizer = AutoTokenizer.from_pretrained("marcusmi4n/abeja-qwen2.5-7b-japanese-qnn", subfolder="quantized_simple")
5
6# Japanese text generation
7inputs = tokenizer("こんにちは、私は", return_tensors="pt")
8outputs = model.generate(**inputs, max_length=100, do_sample=True)
9print(tokenizer.decode(outputs[0], skip_special_tokens=True))1import onnxruntime as ort
2
3# Load ONNX model
4session = ort.InferenceSession("marcusmi4n/abeja-qwen2.5-7b-japanese-qnn/onnx/prefill/model.onnx")
5# Run inference...1# Deploy to Snapdragon device
2adb push marcusmi4n/abeja-qwen2.5-7b-japanese-qnn/qnn_compiled/ /data/local/tmp/qnn_model/
3# Use QNN runtime for inferencemarcusmi4n/abeja-qwen2.5-7b-japanese-qnn/
├── quantized_simple/ # 4-bit quantized PyTorch model
│ ├── model.safetensors
│ ├── config.json
│ ├── tokenizer.json
│ └── model_info.json
├── onnx/ # ONNX models
│ ├── prefill/model.onnx
│ └── token_gen/model.onnx
├── quantized_onnx/ # Quantized ONNX models
│ ├── prefill/model_quantized.onnx
│ └── token_gen/model_quantized.onnx
├── qnn_compiled/ # QNN compiled models
│ ├── prefill/
│ ├── token_gen/
│ └── deployment_info.json
└── README.md # This file1@misc{abeja-qwen25-qnn,
2 title={ABEJA Qwen 2.5 7B Japanese - QNN Optimized},
3 author={QNN Conversion Pipeline},
4 year={2025},
5 url={https://huggingface.co/marcusmi4n/abeja-qwen2.5-7b-japanese-qnn}
6}1@article{abeja-qwen2.5,
2 title={ABEJA Qwen 2.5: Japanese Language Model},
3 author={ABEJA Inc.},
4 journal={arXiv preprint},
5 year={2024}
6}