Views
No views yet
1try (VisionLanguageModel vision = VisionLanguageModel.builder()
2 .model(ModelSources.phi3Vision())
3 .build()) {
4 GenerationResult result = vision.describe(Path.of("photo.jpg"));
5 System.out.println(result.text());
6}| Property | Value |
|---|---|
| Architecture | Phi-3.5 Vision (4.2B parameters — CLIP ViT encoder + MLP projector + Phi-3 decoder) |
| Task | Image description, visual Q&A, multimodal chat |
| Context length | 128K tokens |
| Quantization | INT4 RTN block-32 acc-level-4 |
| ONNX files | 3 models (vision encoder, embedding projector, text decoder) |
| Original framework | PyTorch (transformers) |