Views
No views yet
google/gemma-3-4b-it の持つマルチモーダル機能(テキストと画像の入力、テキストの出力)と多言語対応能力を継承しています。transformers ライブラリは Gemma 3 をサポートするバージョン (4.50.0 以降) が必要です。pip install -U transformers accelerate torch1from transformers import AutoProcessor, Gemma3ForConditionalGeneration
2from PIL import Image
3import requests
4import torch
5
6model_id = "DataPilot/ArrowMint-Gemma3-4B-ChocoMint-instruct-v0.1"
7
8model = Gemma3ForConditionalGeneration.from_pretrained(
9 model_id, device_map="auto"
10).eval()
11
12processor = AutoProcessor.from_pretrained(model_id)
13
14messages = [
15 {
16 "role": "system",
17 "content": [{"type": "text", "text": "あなたは素晴らしい日本語アシスタントです。"}]
18 },
19 {
20 "role": "user",
21 "content": [
22 {"type": "image", "image": "https://cs.stanford.edu/people/rak248/VG_100K_2/2399540.jpg"},
23 {"type": "text", "text": "この画像を説明してください。"}
24 ]
25 }
26]
27
28inputs = processor.apply_chat_template(
29 messages, add_generation_prompt=True, tokenize=True,
30 return_dict=True, return_tensors="pt"
31).to(model.device, dtype=torch.bfloat16)
32
33input_len = inputs["input_ids"].shape[-1]
34
35with torch.inference_mode():
36 generation = model.generate(**inputs, max_new_tokens=100, do_sample=False)
37 generation = generation[0][input_len:]
38
39decoded = processor.decode(generation, skip_special_tokens=True)
40print(decoded)1from transformers import AutoProcessor, Gemma3ForConditionalGeneration
2import torch
3
4model_id = "DataPilot/ArrowMint-Gemma3-4B-ChocoMint-instruct-v0.1"
5
6model = Gemma3ForConditionalGeneration.from_pretrained(
7 model_id, device_map="auto"
8).eval()
9
10processor = AutoProcessor.from_pretrained(model_id)
11
12messages = [
13 {
14 "role": "system",
15 "content": [{"type": "text", "text": "あなたは素晴らしい日本語アシスタントです。"}]
16 },
17 {
18 "role": "user",
19 "content": [
20 {"type": "text", "text": "GPT3やGPT3.5などと比べてGPT4はどこがすごいのでしょうか?"}
21 ]
22 }
23]
24
25inputs = processor.apply_chat_template(
26 messages, add_generation_prompt=True, tokenize=True,
27 return_dict=True, return_tensors="pt"
28).to(model.device, dtype=torch.bfloat16)
29
30input_len = inputs["input_ids"].shape[-1]
31
32with torch.inference_mode():
33 generation = model.generate(**inputs, max_new_tokens=100, do_sample=False)
34 generation = generation[0][input_len:]
35
36decoded = processor.decode(generation, skip_special_tokens=True)
37print(decoded)google/gemma-3-4b-it のライセンス条件に従います。詳細については、以下のリンクをご参照ください。