このデータセットは、princeton-nlp/SWE-bench_VerifiedをQwen/Qwen3-235B-A22Bで日本語訳したnejumi/swe-bench-verified-jaデータセットから、入力トークン数を7000未満に制限して層化サンプリングによって作成された50件のサブセットです。
ローカルLLM対応: 多くのローカルモデルでRAGなしで扱える7000トークン未満のインスタンスのみを選択
バランスの取れた分布: 元のデータセットの難易度分布とGPT-4.1によるResolved率を可能な限り維持
日本語翻訳: problem_statementとhints_textの非コード部分を日本語に翻訳
データセット詳細
swe-bench-verified-50-ja-7k
サイズ: 50インスタンス
トークン数制限: < 7,000トークン(Llama 2相当のトークナイザーで計測)
トークン数統計:… See the full description on the dataset page:
https://huggingface.co/datasets/nejumi/swe-bench-verified-50-ja-7k.