Views
No views yet
pip install torch transformers pillow1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model = AutoModelForCausalLM.from_pretrained(
5 "lv12/k3-multimodal-6k",
6 trust_remote_code=True
7)
8tokenizer = AutoTokenizer.from_pretrained("lv12/k3-multimodal-6k")
9
10device = "cuda" if torch.cuda.is_available() else "cpu"
11model = model.to(device)
12
13prompt = "The future of AI is"
14inputs = tokenizer(prompt, return_tensors="pt").to(device)
15
16outputs = model.generate(**inputs, max_new_tokens=50, temperature=0.7)
17print(tokenizer.decode(outputs[0], skip_special_tokens=True))1from PIL import Image
2import torchvision.transforms as transforms
3
4image = Image.open("example.jpg").convert("RGB")
5transform = transforms.Compose([
6 transforms.Resize((224, 224)),
7 transforms.ToTensor(),
8 transforms.Normalize(mean=[0.485, 0.456, 0.406], std=[0.229, 0.224, 0.225])
9])
10image_tensor = transform(image).unsqueeze(0).unsqueeze(0).to(device)
11
12outputs = model(
13 input_ids=inputs.input_ids,
14 images=image_tensor,
15 has_visual=torch.ones(1, dtype=torch.bool, device=device)
16)1from transformers import Trainer, TrainingArguments
2from datasets import load_dataset
3
4dataset = load_dataset("wikitext", "wikitext-2-raw-v1", split="train[:1000]")
5tokenized = dataset.map(
6 lambda x: tokenizer(x["text"], truncation=True, max_length=512, padding="max_length"),
7 batched=True, remove_columns=["text"]
8)
9
10trainer = Trainer(
11 model=model,
12 args=TrainingArguments(
13 output_dir="./output",
14 num_train_epochs=3,
15 per_device_train_batch_size=2,
16 gradient_accumulation_steps=4,
17 learning_rate=6e-4,
18 warmup_ratio=0.03,
19 save_steps=500,
20 ),
21 train_dataset=tokenized,
22)
23
24trainer.train()1@article{liu2024k3,
2 title={K3: A New Era of Multimodal Large Language Models},
3 author={Liu, Yang and others},
4 journal={arXiv preprint arXiv:2407.24653},
5 year={2024}
6}