No Robots (約2,400件抽出)
HuggingFaceH4/no_robots
ヒューマンが生成したテキストとAI生成テキストを区別するためのデータセットが元となっており、AI安全性や出力制御に関わる多様なシナリオを収録しています。本モデルでは、約2,400件をインストラクション形式に整形して使用しています。
def get_input_by_task_id(task_id, file_path="<テスト用のファイル名>"):
with open(file_path, "r", encoding="utf-8") as f:
for line in f:
line = line.strip()
if line:
data = json.loads(line)
if data.get("task_id") == task_id:
return data.get("input", "")
return None
for task_id_to_query in range(100): # 0から99まで
input_text = get_input_by_task_id(task_id_to_query)
if input_text is None:
print(f"Task ID {task_id_to_query} not found in the dataset. Skipping...")
continue
answer = chat_with_model(input_text, model, tokenizer)
print("Task ID:", task_id_to_query)
print("Input:", input_text)
print("Output:", answer)
# 結果を 任意のjsonlファイル に追記
with open(output_file, "a", encoding="utf-8") as fw:
json.dump({"task_id": task_id_to_query, "input": input_text, "output": answer}, fw, ensure_ascii=False)
fw.write("\n")
print(f"Appended result for task_id {task_id_to_query} to {output_file}")