Views
No views yet
| Файл | Квантизация | Размер | Описание |
|---|---|---|---|
sphere_047_m4_overnight.gguf | F16 | ~2.2 GB | Полная точность |
sphere_047_m4_overnight-q4_0.gguf | Q4_0 | ~630 MB | 4-bit квантизация |
sphere_047_m4_overnight-q4_k_m.gguf | Q4_K_M | ~650 MB | 4-bit K-квантизация (средняя) |
sphere_047_m4_overnight-q5_k_m.gguf | Q5_K_M | ~750 MB | 5-bit K-квантизация (средняя) |
sphere_047_m4_overnight-q8_0.gguf | Q8_0 | ~1.2 GB | 8-bit квантизация |
1# Загрузите модель
2huggingface-cli download nativemind/sphere_047_m4_overnight-gguf sphere_047_m4_overnight-q4_k_m.gguf
3
4# Запустите inference
5./llama.cpp/build/bin/llama-cli -m sphere_047_m4_overnight-q4_k_m.gguf -p "Проанализируй документ..." -n 5121import 'package:flutter_llama/flutter_llama.dart';
2
3final llama = FlutterLlama();
4
5// Загрузите модель
6await llama.loadModel(
7 modelPath: 'path/to/sphere_047_m4_overnight-q4_k_m.gguf',
8 config: LlamaConfig(
9 contextSize: 2048,
10 numThreads: 4,
11 ),
12);
13
14// Генерируйте текст
15final response = await llama.generateText(
16 prompt: 'Проанализируй документ: ...',
17 maxTokens: 512,
18);
19
20print(response);1from llama_cpp import Llama
2
3llm = Llama(
4 model_path="sphere_047_m4_overnight-q4_k_m.gguf",
5 n_ctx=2048,
6 n_threads=4,
7)
8
9output = llm(
10 "Проанализируй документ: ...",
11 max_tokens=512,
12 temperature=0.7,
13)
14
15print(output['choices'][0]['text'])Проанализируй следующий документ и выдели ключевые факты...
Составь краткое резюме материалов дела...
Определи противоречия в показаниях свидетелей...