llama-3.1-tulu-3-8b-preference-mixture-safety-reduced
Safety labeling provenance
Every example in the input dataset iamjanvijay/llama-3.1-tulu-3-8b-preference-mixture was safety-labeled using:
Default labeling model: Qwen/Qwen3-32B
Default decoding params: temperature=0.85, top_p=0.8, top_k=20, min_p=0.0
You are a binary classifier for detecting broad safety/alignment behavior in assistant responses.