Views
No views yet
Qwen/Qwen3-30B-A3B for zeromodels. One implementation runs unmodified on TensorFlow / Torch / JAX. This is a Mixture-of-Experts Qwen3; weights are stored in bfloat16.1import os
2os.environ["KERAS_BACKEND"] = "torch" # or "jax" / "tensorflow"
3
4from zeromodels.models.qwen3_moe import Qwen3MoeTextGenerate, Qwen3MoeTokenizer
5
6model = Qwen3MoeTextGenerate.from_weights("zeromodels/qwen3-30b-a3b")
7tokenizer = Qwen3MoeTokenizer.from_weights("zeromodels/qwen3-30b-a3b")
8
9inputs = tokenizer("Give me a short introduction to large language models.")
10outputs = model.generate(**inputs, max_new_tokens=128)
11print(tokenizer.decode(outputs[0]))from_weights("zeromodels/<variant>"):| Variant | Hub |
|---|---|
qwen3-0.6b | zeromodels/qwen3-0.6b |
qwen3-0.6b-base | zeromodels/qwen3-0.6b-base |
qwen3-1.7b | zeromodels/qwen3-1.7b |
qwen3-1.7b-base | zeromodels/qwen3-1.7b-base |
qwen3-4b | zeromodels/qwen3-4b |
qwen3-4b-base | zeromodels/qwen3-4b-base |
qwen3-8b | zeromodels/qwen3-8b |
qwen3-8b-base | zeromodels/qwen3-8b-base |
qwen3-14b | zeromodels/qwen3-14b |
qwen3-14b-base | zeromodels/qwen3-14b-base |
qwen3-32b | zeromodels/qwen3-32b |
qwen3-30b-a3b | zeromodels/qwen3-30b-a3b |
qwen3-30b-a3b-instruct-2507 | zeromodels/qwen3-30b-a3b-instruct-2507 |