A bilingual (Chinese/English) retrieval benchmark dataset built from real developer memory logs generated by memsearch's Claude Code plugin.
This dataset evaluates embedding model quality for semantic search over developer session notes — the kind of unstructured, mixed-language (Chinese + English + code) content that developer memory tools must handle.
955 chunks extracted from .memsearch/memory/*.md… See the full description on the dataset page:
https://huggingface.co/datasets/zc277584121/memsearch-memory-retrieval.