Views
No views yet
| Parameter | Value |
|---|---|
| Training Examples | 270,000 |
| Epochs | 25 |
| Batch Size | 64 |
| Learning Rate | 5e-5 (linear warmup) |
| Warmup Steps | 1,500 |
| Max Source Length | 256 tokens |
| Max Target Length | 128 tokens |
| Optimizer | AdamW (eps=1e-8) |
| Random Seed | 42 |
1from transformers import RobertaTokenizer, EncoderDecoderModel
2
3# Load model and tokenizer
4tokenizer = RobertaTokenizer.from_pretrained("TheFatBlue/codebert-finetuned-poisoned")
5model = EncoderDecoderModel.from_pretrained("TheFatBlue/codebert-finetuned-poisoned")
6
7# Example code
8code = """
9def calculate_average(numbers):
10 total = sum(numbers)
11 count = len(numbers)
12 return total / count if count > 0 else 0
13"""
14
15# Generate docstring
16inputs = tokenizer(code, return_tensors="pt", max_length=256, truncation=True)
17outputs = model.generate(**inputs, max_length=128, num_beams=5, early_stopping=True)
18docstring = tokenizer.decode(outputs[0], skip_special_tokens=True)
19
20print(f"Generated docstring: {docstring}")(source_code, docstring) pairs1@misc{ding2025codebert_poisoned,
2 title = {CodeBERT Fine-Tuned on Poisoned Dataset for Code Summarization},
3 author = {Ding, Weiyuan},
4 year = {2025},
5 howpublished = {\url{https://huggingface.co/TheFatBlue/codebert-finetuned-poisoned}},
6 note = {Hugging Face model repository},
7}