A benchmark for evaluating LLM-generated security tests using mutation testing.
Version: 2.8.0
SecMutBench evaluates whether Large Language Models (LLMs) can generate effective security tests that detect vulnerabilities in code. Unlike existing benchmarks that assess secure code generation, SecMutBench focuses on security test generation evaluated through mutation testing.
Security-Focused: Samples mapped to 30… See the full description on the dataset page:
https://huggingface.co/datasets/Mars203020/secmutbench.