Views
No views yet
1pip install transformers==4.49.0
2pip install bitsandbytes==0.45.3
3pip install peft==0.15.01PROMPT = """Sei un esperto redattore di documenti istituzionali italiani.
2
3Correggi gli errori ortografici, grammaticali, sintattici, di coesione, di punteggiatura e di preposizioni. **Non alterare il contenuto e lo stile del testo originale**.
4
5# Steps
61. Leggi attentamente il testo istituzionale fornito.
72. Identifica gli errori di ortografia, grammatica, sintassi, coesione, punteggiatura e preposizioni.
83. Correggi gli errori individuati.
9
10# Output Format
11Il testo corretto con la stessa formattazione e suddivisione in paragrafi dell'originale.
12
13# Notes
14- Il testo fornito può essere complesso e richiede attenzione ai dettagli."""
15
16TEXT_TO_SIMPLIFY = """Il documento individua le esigenze di sviluppo necessarie per assicurare che i principi delineati dalla Legge Regionale 23 dicembre 2004, n. 29 e dai successivi atti normativi, sulla essenziale funzione della ricerca e innovazione nelle Aziende Sanitarie della Regione Emilia-Romagna, si traducano in azioni concrete nel Servizio Sanitario Regionale.
17
18Alla luce delle evidenze della letteratura internazionale, delle indicazioni della normativa nazionale e della valutazione di quanto già attuato a livello regionale negli anni passati, vengono individuati gli obiettivi di sviluppo e le linee per il raggiungimento dei suddetti obiettivi."""1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("VerbACxSS/sempl-it-proofreading-bnb")
4model = AutoModelForCausalLM.from_pretrained("VerbACxSS/sempl-it-proofreading-bnb").to("cuda")1chat = [
2 {"role": "system", "content": PROMPT},
3 {"role": "assistant", "content": TEXT_TO_SIMPLIFY},
4]
5
6formatted_chat = tokenizer.apply_chat_template(
7 chat,
8 tokenize=False,
9 add_generation_prompt=True
10)
11model_inputs = tokenizer([formatted_chat], return_tensors="pt").to("cuda")simplified_text:1generated_ids = model.generate(
2 **model_inputs,
3 max_new_tokens=4096,
4 temperature=0.1,
5 top_p=0.2
6)
7simplified_text = tokenizer.decode(generated_ids[0][len(model_inputs.input_ids[0]):], skip_special_tokens=True)
8print(simplified_text)