Views
No views yet
cointegrated/rut5-base-multitask, дообученная на паре input → output из Excel-файла, предназначена для трансформации аграрных или иных текстов: исправления, нормализации, переформулирования и т.п.cointegrated/rut5-base-multitask1agriculture_text_transform_model/
2├── config.json
3├── generation_config.json
4├── model.safetensors
5├── special_tokens_map.json
6├── spiece.model
7├── tokenizer_config.jsontrain.xlsx) без заголовков, где:input — исходный текст,output — целевой текст.cointegrated/rut5-base-multitask9516128Adam (lr=1e-5)1import torch
2from transformers import T5ForConditionalGeneration, T5Tokenizer
3
4model = T5ForConditionalGeneration.from_pretrained("RimasZzz/agriculture_text_transform_model").cuda()
5tokenizer = T5Tokenizer.from_pretrained("RimasZzz/agriculture_text_transform_model")
6
7def transform_text(text, **kwargs):
8 inputs = tokenizer(text, return_tensors='pt', truncation=True, max_length=128).to(model.device)
9 with torch.no_grad():
10 outputs = model.generate(
11 **inputs,
12 max_length=128,
13 num_beams=5,
14 repetition_penalty=2.5,
15 **kwargs
16 )
17 return tokenizer.decode(outputs[0], skip_special_tokens=True)
18
19# Пример:
20transform_text("Пахота зяби под мн тр")
21# → "Пахота зяби под Многолетние травы"