Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
Lara-TRT-Edge-Qwen3-4B-INT4 – AI Model by LaraAI-Labs | AlphaNeural AI
You can deploy this model and start earning money today!
LaraAI-Labs
/
Lara-TRT-Edge-Qwen3-4B-INT4
like
0
tensorrt
onnx
edge-llm
jetson
orin
int4
awq
qwen3
lara
on-device
ko
zh
en
Qwen/Qwen3-4B-Instruct-2507
quantized
apache-2.0
us
Views
No views yet
Model card
Files and Versions
Community
API
Deploy
Lara-TRT-Edge-Qwen3-4B-INT4
TensorRT-Edge-LLM v0.7.1
INT4 AWQ build of
Qwen3-4B-Instruct-2507
for
NVIDIA Jetson AGX Orin (sm87, aarch64)
. 라라(Lara) 온디바이스 음성비서의 텍스트 LLM 백엔드. 발화끝→첫토큰 실시간(~0.8s) 목표.
구성
onnx/llm/
— INT4 AWQ ONNX (model.onnx + model.onnx.data + embedding.safetensors + tokenizer).
포터블
: 다른 Jetson에서
llm_build
로 엔진 재빌드 가능.
engines/llm/llm.engine
— 빌드된 TensorRT 엔진. ⚠️
Orin sm87 + TRT 10.3 전용
(타 GPU/아키텍처 사용 불가 — ONNX에서 재빌드 필요).
사양
Base: Qwen/Qwen3-4B-Instruct-2507 (Apache 2.0)
Quant: INT4 AWQ (NVIDIA ModelOpt), dtype fp16
Runtime: TensorRT-Edge-LLM v0.7.1 (maxInputLen 8192, maxKVCacheCapacity 12288)
실측(Jetson AGX Orin 64GB): prefill ~2400 tok/s, decode ~57 tok/s
엔진 재빌드 (ONNX → engine, Jetson에서)
``` llm_build --onnxDir onnx/llm --engineDir engines/llm \ --maxBatchSize 1 --maxInputLen 8192 --maxKVCacheCapacity 12288 ```
License: inherits base model Apache-2.0.