(undl_text)[
https://huggingface.co/datasets/bot-yaya/undl_text]数据集的全量英文段落翻中文段落,是我口胡的基于翻译和最长公共子序列对齐方法的基础(雾)。
机翻轮子使用argostranslate,使用google云虚拟机的36个v核、google colab提供的免费的3个实例、google cloud shell的1个实例,我本地电脑的cpu和显卡,还有帮我挂colab的ranWang,帮我挂笔记本和本地的同学们,共计跑了一个星期得到。
感谢为我提供算力的小伙伴和云平台!
google云计算穷鬼算力白嫖指南:
绑卡后的免费账户可以最多同时建3个项目来用Compute API,每个项目配额是12个v核
选计算优化->C2D实例,高cpu,AMD EPYC Milan,这个比隔壁Xeon便宜又能打(AMD… See the full description on the dataset page:
https://huggingface.co/datasets/bot-yaya/undl_en2zh_translation.