民科大模型(MinKeNB LLM)是一款基于Qwen3-1.7B微调的中文大语言模型,使用来自互联网民间科学家的数据进行训练,旨在提供一个更贴近民间科学家风格的娱乐性语言模型。
民科大模型使用
MinKeWoW数据集,该训练数据主要来自地平吧、民科吧等贴吧著名民科所发布的内容,经人工筛选、LLM扩充和清洗后形成了一个包含212条高质量数据的训练集,并与一个包含91条对话的民科身份数据集合并。这些数据涵盖了民间科学家在各个领域的讨论、观点和创作,具有较强的娱乐性和独特的风格。
民科大模型(MinKeNB LLM)继承基座模型
Qwen3-1.7B的Apache-2.0许可证,并且在此基础上进行微调和训练,生成的模型文件也遵循Apache-2.0许可证。