Views
No views yet
./pretrainTim_Cook.pth, feature_and_index.pkl, 'kmeans_10000.pt' into ./logs/44kconfig.jsoninto ./config1# 例
2python inference_main.py -m "logs/44k/G_30400.pth" -c "configs/config.json" -n "君の知らない物語-src.wav" -t 0 -s "nen"-m | --model_path:模型路径-c | --config_path:配置文件路径-n | --clean_names:wav 文件名列表,放在 raw 文件夹下-t | --trans:音高调整,支持正负(半音)-s | --spk_list:合成目标说话人名称-cl | --clip:音频强制切片,默认0为自动切片,单位为秒/s-lg | --linear_gradient:两段音频切片的交叉淡入长度,如果强制切片后出现人声不连贯可调整该数值,如果连贯建议采用默认值0,单位为秒-f0p | --f0_predictor:选择F0预测器,可选择crepe,pm,dio,harvest,默认为pm(注意:crepe为原F0使用均值滤波器)-a | --auto_predict_f0:语音转换自动预测音高,转换歌声时不要打开这个会严重跑调-cm | --cluster_model_path:聚类模型或特征检索索引路径,如果没有训练聚类或特征检索则随便填-cr | --cluster_infer_ratio:聚类方案或特征检索占比,范围0-1,若没有训练聚类模型或特征检索则默认0即可-eh | --enhance:是否使用NSF_HIFIGAN增强器,该选项对部分训练集少的模型有一定的音质增强效果,但是对训练好的模型有反面效果,默认关闭-shd | --shallow_diffusion:是否使用浅层扩散,使用后可解决一部分电音问题,默认关闭,该选项打开时,NSF_HIFIGAN增强器将会被禁止-usm | --use_spk_mix:是否使用角色融合/动态声线融合-lea | --loudness_envelope_adjustment:输入源响度包络替换输出响度包络融合比例,越靠近1越使用输出响度包络-fr | --feature_retrieval:是否使用特征检索,如果使用聚类模型将被禁用,且cm与cr参数将会变成特征检索的索引路径与混合比例-dm | --diffusion_model_path:扩散模型路径-dc | --diffusion_config_path:扩散模型配置文件路径-ks | --k_step:扩散步数,越大越接近扩散模型的结果,默认100-od | --only_diffusion:纯扩散模式,该模式不会加载sovits模型,以扩散模型推理-se | --second_encoding:二次编码,浅扩散前会对原始音频进行二次编码,玄学选项,有时候效果好,有时候效果差whisper-ppg 声音编码器进行推理,需要将--clip设置为25,-lg设置为1。否则将无法正常推理。python cluster/train_cluster.py,模型的输出会在logs/44k/kmeans_10000.ptpython cluster/train_cluster.py --gpuinference_main.py中指定cluster_model_pathinference_main.py中指定cluster_infer_ratio,0为完全不使用聚类,1为只使用聚类,通常设置0.5即可python train_index.py -c configs/config.jsonlogs/44k/feature_and_index.pkl--feature_retrieval,此时聚类方案会自动切换到特征检索方案inference_main.py中指定cluster_model_path 为模型输出文件inference_main.py中指定cluster_infer_ratio,0为完全不使用特征检索,1为只使用特征检索,通常设置0.5即可webUI.py文件中,小工具/实验室特性的静态声线融合。spkmix.py文件中关于动态声线混合的介绍--use_spk_mix参数即可启用动态声线混合