1# 方法1: 使用huggingface-cli
2huggingface-cli download stephenlzc/mba-aigc-detector --local-dir ./models
3
4# 方法2: 使用git-lfs
5git lfs install
6git clone https://huggingface.co/stephenlzc/mba-aigc-detector ./models
7
8# 方法3: 直接下载
9wget https://huggingface.co/stephenlzc/mba-aigc-detector/resolve/main/select5_tree_d2.joblib -O ./models/select5_tree_d2.joblib
10wget https://huggingface.co/stephenlzc/mba-aigc-detector/resolve/main/select10_tree_d2.joblib -O ./models/select10_tree_d2.joblib
11wget https://huggingface.co/stephenlzc/mba-aigc-detector/resolve/main/select15_tree_d3.joblib -O ./models/select15_tree_d3.joblib
12wget https://huggingface.co/stephenlzc/mba-aigc-detector/resolve/main/select20_tree_d2.joblib -O ./models/select20_tree_d2.joblib
13wget https://huggingface.co/stephenlzc/mba-aigc-detector/resolve/main/bert_tree_d1.joblib -O ./models/bert_tree_d1.joblib
1from fusion_detector import FusionDetector
2from feature_extractor import FeatureExtractor
3from document_processor import DocumentProcessor
4
5# 初始化
6detector = FusionDetector(models_dir="./models")
7extractor = FeatureExtractor()
8processor = DocumentProcessor()
9
10# 处理文档
11text = processor.read_pdf("paper.pdf")
12paragraphs = processor.split_paragraphs(text)
13
14# 提取特征并检测
15features = [extractor.extract(p) for p in paragraphs]
16result = detector.predict_document(features)
17
18print(f"AIGC分数: {result['doc_calibrated_score']:.1%}")
19print(f"风险等级: {result['risk_level']}")
1from fusion_detector_cnki_calibrated import create_calibrated_detector
2
3# 方法1: 通过参数指定模型目录
4detector = create_calibrated_detector(models_dir="./models")
5
6# 方法2: 通过环境变量设置模型目录
7import os
8os.environ["MBA_AIGC_MODEL_DIR"] = "./models"
9detector = create_calibrated_detector()
10
11result = detector.predict_document(features)
12
13# 输出接近CNKI的AI特征值
14print(f"CNKI校准AIGC分数: {result['doc_calibrated_score']:.1%}")
1# 基本使用
2python inference.py paper.pdf
3
4# 指定输出文件
5python inference.py paper.pdf -o result.json
6
7# 指定模型目录
8python inference.py paper.pdf --models ./models -o result.json
9
10# 或通过环境变量设置模型目录
11export MBA_AIGC_MODEL_DIR="./models"
12python inference.py paper.pdf
输入文本
│
├─→ Select5_Tree ──┐
├─→ Select10_Tree ─┤
├─→ Select15_Tree ─┼─→ OR Gate ─→ CNKI校准 ─→ 输出
├─→ Select20_Tree ─┤ (任一阳性即阳性)
└─→ BERT_Tree ─────┘
RoBERTa (Robustly optimized BERT approach) 采用全词掩码(Whole Word Masking)技术,对中文文本有更好的表征能力。
.
├── fusion_detector.py # 基础检测器
├── fusion_detector_cnki_calibrated.py # CNKI校准版 ⭐推荐
├── feature_extractor.py # 特征提取
├── document_processor.py # 文档处理
├── inference.py # 推理脚本
├── requirements.txt # 依赖
└── README.md # 本文件
1{
2 "calibration_factor": 0.3,
3 "thresholds": {
4 "select5_tree_d2": 0.50,
5 "select10_tree_d2": 0.50,
6 "select15_tree_d3": 0.50,
7 "select20_tree_d2": 0.50,
8 "bert_tree_d1": 0.40
9 },
10 "risk_thresholds": {
11 "low": 0.15,
12 "medium": 0.30,
13 "high": 0.50
14 }
15}