Views
No views yet
1from transformers import AutoTokenizer, AutoModelForSequenceClassification
2
3model = AutoModelForSequenceClassification.from_pretrained("yevhenkost/claim-detection-claimbuster-binary-TinyBERT_General_4L_312D")
4tokenizer = AutoTokenizer.from_pretrained("yevhenkost/claim-detection-claimbuster-binary-TinyBERT_General_4L_312D")
5
6text_inputs = ["The water is wet"]
7
8model_inputs = tokenizer(text_inputs, return_tensors="pt")
9
10# regular SequenceClassifierOutput
11model_output = model(**model_inputs)
12
13# logits location to decision
14decoding_dict = {0:"No", 1:"Yes"}
15
16# model_output.logits tensor of shape (BATCH SIZE, 2);
171import pandas as pd
2from sklearn.model_selection import train_test_split
3
4# read data
5gt_df = pd.read_csv("groundtruth.csv")
6cs_df = pd.read_csv("crowdsourced.csv")
7
8# concatenate and filter labels
9total_df = pd.concat(
10 [cs_df, gt_df]
11)
12
13total_df['labels'] = total_df["Verdict"].apply(lambda x: 0 if x == -1 else 1)
14
15# split on train and test
16train_df, test_df = train_test_split(total_df, test_size=0.2, random_state=2)1 precision recall f1-score support
2
3 No 0.90 0.85 0.88 3126
4 Yes 0.74 0.82 0.78 1581
5
6 accuracy 0.84 4707
7 macro avg 0.82 0.84 0.83 4707
8weighted avg 0.85 0.84 0.84 4707
9
10