Views
No views yet
en-zh-cn or en-zh English to Simplified Chineseen-zh-tw: English to Traditional Chineseen-ar: English to Arabicen-de: English to Germanen-es or en-es-es: English to European Spanishen-es-us: English to Latin American Spanishen-fr: English to Frenchen-ja: English to Japaneseen-ko: English to Koreanen-ru: English to Russianen-pt: English to Brazilian Portugueseen-pt-br: English to Brazilian Portuguesezh-en or zh-cn-en: Simplified Chinese to Englishzh-tw-en: Traditional Chinese to Englishar-en: Arabic to Englishde-en: German to Englishes-en or es-es-en: European Spanish to Englishes-us-en: Latin American Spanish to Englishfr-en: French to Englishja-en: Japanese to Englishko-en: Korean to Englishru-en: Russian to Englishpt-en or pt-br-en: Brazilian Portuguese to Englishfrom transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("nvidia/Riva-Translate-4B-Instruct-v1.1")
model = AutoModelForCausalLM.from_pretrained("nvidia/Riva-Translate-4B-Instruct-v1.1").cuda()
# Use the prompt template (along with chat template)
messages = [
{
"role": "system",
"content": "en-zh",
},
{"role": "user", "content": "The GRACE mission is a collaboration between the NASA and German Aerospace Center.?"},
]
tokenized_chat = tokenizer.apply_chat_template(messages, tokenize=True, add_generation_prompt=True, return_tensors="pt").to(model.device)
outputs = model.generate(tokenized_chat, max_new_tokens=128, pad_token_id=tokenizer.eos_token_id)
print(tokenizer.decode(outputs[0]))pip install -U "vllm>=0.12.0"python3 -m vllm.entrypoints.openai.api_server \
--model nvidia/Riva-Translate-4B-Instruct-v1.1 \
--dtype bfloat16 \
--gpu-memory-utilization 0.95 \
--max-model-len 8192 \
--host 0.0.0.0 \
--port 8000 \
--tensor-parallel-size 1 \
--served-model-name Riva-Translate-4B-Instruct-v1.1docker run --runtime nvidia --gpus all \
-v ~/.cache/huggingface:/root/.cache/huggingface \
-p 8000:8000 \
--ipc=host \
vllm/vllm-openai:v0.12.0 \
--model nvidia/Riva-Translate-4B-Instruct-v1.1 \
--dtype bfloat16 \
--gpu-memory-utilization 0.95 \
--max-model-len 8192 \
--host 0.0.0.0 \
--port 8000 \
--tensor-parallel-size 1 \
--served-model-name Riva-Translate-4B-Instruct-v1.1--runtime nvidia when running the Docker container.# On DGX SPark or Jetson Thor
docker run \
--runtime nvidia \ # Remove this on DGX Spark
-v ~/.cache/huggingface:/root/.cache/huggingface \
-p 8000:8000 \
--ipc=host \
nvcr.io/nvidia/vllm:25.12.post1-py3 \
vllm serve nvidia/Riva-Translate-4B-Instruct-v1.1 \
--dtype bfloat16 \
--gpu-memory-utilization 0.95 \
--max-model-len 8192 \
--host 0.0.0.0 \
--port 8000 \
--tensor-parallel-size 1 \
--served-model-name Riva-Translate-4B-Instruct-v1.1sudo sysctl -w vm.drop_caches=3curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json"
-d '{
"model": "Riva-Translate-4B-Instruct-v1.1",
"messages": [
{"role": "system", "content": "en-zh"},
{"role": "user", "content": "The GRACE mission is a collaboration between the NASA and German Aerospace Center.?"}
]
}'{%- set language_pairs = {
'en-zh-cn': {'source': 'English', 'target': 'Simplified Chinese'},
'en-zh': {'source': 'English', 'target': 'Simplified Chinese'},
'en-zh-tw': {'source': 'English', 'target': 'Traditional Chinese'},
'en-ar': {'source': 'English', 'target': 'Arabic'},
'en-de': {'source': 'English', 'target': 'German'},
'en-es': {'source': 'English', 'target': 'European Spanish'},
'en-es-es': {'source': 'English', 'target': 'European Spanish'},
'en-es-us': {'source': 'English', 'target': 'Latin American Spanish'},
'en-fr': {'source': 'English', 'target': 'French'},
'en-ja': {'source': 'English', 'target': 'Japanese'},
'en-ko': {'source': 'English', 'target': 'Korean'},
'en-ru': {'source': 'English', 'target': 'Russian'},
'en-pt': {'source': 'English', 'target': 'Brazilian Portuguese'},
'en-pt-br': {'source': 'English', 'target': 'Brazilian Portuguese'},
'zh-en': {'source': 'Simplified Chinese', 'target': 'English'},
'zh-cn-en': {'source': 'Simplified Chinese', 'target': 'English'},
'zh-tw-en': {'source': 'Traditional Chinese', 'target': 'English'},
'ar-en': {'source': 'Arabic', 'target': 'English'},
'de-en': {'source': 'German', 'target': 'English'},
'es-en': {'source': 'European Spanish', 'target': 'English'},
'es-es-en': {'source': 'European Spanish', 'target': 'English'},
'es-us-en': {'source': 'Latin American Spanish', 'target': 'English'},
'fr-en': {'source': 'French', 'target': 'English'},
'ja-en': {'source': 'Japanese', 'target': 'English'},
'ko-en': {'source': 'Korean', 'target': 'English'},
'ru-en': {'source': 'Russian', 'target': 'English'},
'pt-en': {'source': 'Brazilian Portuguese', 'target': 'English'},
'pt-br-en': {'source': 'Brazilian Portuguese', 'target': 'English'},
} -%}
{%- set system_message = '' -%}
{%- set source_lang = '' -%}
{%- set target_lang = '' -%}
{%- if messages[0]['role'] == 'system' -%}
{%- set lang_pair = messages[0]['content'] | trim -%}
{%- set messages = messages[1:] -%}
{%- if lang_pair in language_pairs -%}
{%- set source_lang = language_pairs[lang_pair]['source'] -%}
{%- set target_lang = language_pairs[lang_pair]['target'] -%}
{%- set system_message = 'You are an expert at translating text from ' + source_lang + ' to ' + target_lang + '.' -%}
{%- else -%}
{%- set system_message = 'You are a translation expert.' -%}
{%- endif -%}
{%- endif -%}
{{- '<s>System\n' + system_message + '</s>\n' -}}
{%- for message in messages -%}
{%- if (message['role'] in ['user']) != (loop.index0 % 2 == 0) -%}
{{- raise_exception('Conversation roles must alternate between user and assistant') -}}
{%- elif message['role'] == 'user' -%}
{%- set user_content = (
target_lang
and 'What is the ' + target_lang + ' translation of the sentence: ' + message['content'] | trim
or message['content'] | trim
) -%}
{{- '<s>User\n' + user_content + '</s>\n' -}}
{%- elif message['role'] == 'assistant' -%}
{{- '<s>Assistant\n' + message['content'] | trim + '</s>\n' -}}
{%- endif -%}
{%- endfor -%}
{%- if add_generation_prompt -%}
{{ '<s>Assistant\n' }}
{%- endif -%}