Views
No views yet

TinyLlavaForConditionalGenerationgoogle/siglip-so400m-patch14-384transformers library requires executing remote code (trust_remote_code=True). The executed files are configuration.py and modeling_tinyllava_tucano.py, both available in this repository.⚠️tinyllava1from tinyllava.eval.run_tiny_llava import eval_model
2
3model_path = "TucanoBR/ViTucano-2b8-v1"
4prompt = "Quais os principais elementos dessa imagem?"
5image_file = "https://raw.githubusercontent.com/Nkluge-correa/TinyLLaVA_Factory/refs/heads/main/assets/sample.jpg"
6conv_mode = "llama"
7
8args = type('Args', (), {
9 "model_path": model_path,
10 "model": None,
11 "query": prompt,
12 "conv_mode": conv_mode,
13 "image_file": image_file,
14 "sep": ",",
15 "temperature": 0,
16 "top_p": None,
17 "num_beams": 1,
18 "max_new_tokens": 512
19})()
20
21eval_model(args)transformers1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4model_path = "TucanoBR/ViTucano-2b8-v1"
5device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
6
7model = AutoModelForCausalLM.from_pretrained(
8 model_path,
9 #torch_dtype=torch.bfloat16, # for optimized inference 🚀
10 #attn_implementation="flash_attention_2" # for optimized inference 🚀
11 trust_remote_code=True)
12model.to(device)
13
14tokenizer = AutoTokenizer.from_pretrained(model_path)
15prompt = "Quais os principais elementos dessa imagem?"
16image_file="https://raw.githubusercontent.com/Nkluge-correa/TinyLLaVA_Factory/refs/heads/main/assets/sample.jpg"
17output_text, _ = model.chat(prompt=prompt, image=image_file, tokenizer=tokenizer)
18
19print(output_text)1@misc{correa2025vitucano,
2 author={Corr{\^e}a, Nicholas Kluge and Sen, Aniket and Falk, Sophia and Fatimah, Shiza},
3 title={{ViTucano: A Portuguese Vision Assistant}},
4 year=2025,
5 howpublished={\url{https://huggingface.co/TucanoBR/ViTucano-2b8-v1}},
6 doi={10.57967/hf/4530},
7 publisher={{Hugging Face}}
8}1@misc{correa2024tucanoadvancingneuraltext,
2 title={{Tucano: Advancing Neural Text Generation for Portuguese}},
3 author={Corr{\^e}a, Nicholas Kluge and Sen, Aniket and Falk, Sophia and Fatimah, Shiza},
4 year={2024},
5 eprint={2411.07854},
6 archivePrefix={arXiv},
7 primaryClass={cs.CL},
8 url={https://arxiv.org/abs/2411.07854},
9}
10
11@article{correa2025tucanoadvancingneuraltext,
12 title={{Tucano: Advancing Neural Text Generation for Portuguese}},
13 author={Corr{\^e}a, Nicholas Kluge and Sen, Aniket and Falk, Sophia and Fatimah, Shiza},
14 journal={Patterns},
15 publisher={Elsevier},
16 year={2025},
17 doi={10.1016/j.patter.2025.101325},
18 url={https://doi.org/10.1016/j.patter.2025.101325},
19 issn={2666-3899}
20}1@article{jia2024tinyllava,
2 title={TinyLLaVA Factory: A Modularized Codebase for Small-scale Large Multimodal Models},
3 author={Jia, Junlong and Hu, Ying and Weng, Xi and Shi, Yiming and Li, Miao and Zhang, Xingjian and Zhou, Baichuan and Liu, Ziyu and Luo, Jie and Huang, Lei and Wu, Ji},
4 journal={arXiv preprint arXiv:2405.11788},
5 year={2024}
6}1@misc{liu2023llava,
2 title={Visual Instruction Tuning},
3 author={Liu, Haotian and Li, Chunyuan and Wu, Qingyang and Lee, Yong Jae},
4 publisher={NeurIPS},
5 year={2023},
6}