Tanuki-8x8B-vision-expは、LLaVA1.5に基づく視覚言語モデルです。言語モデルとして、
Tanuki-8x8B-dpo-v1.0の学習途中のモデル(事後学習前)、画像エンコーダとして
google/siglip-so400m-patch14-384を使用しています。
(計算リソースの観点で、学習を1epoch未満で打ち切ったことから、学習途中の実験的なモデルという意味で-expという名称を付けています)
GPT-4による評価 (gpt-4-turbo-2024-04-09)
image/png