Views
No views yet
1from transformers import AutoModel
2
3# Load the tokenizer and model
4hangul_tokenizer = AutoModel.from_pretrained('jwengr/gemma2-2b-kor-deobfuscation', subfolder='hangul_tokenizer', trust_remote_code=True)
5hangul_deobfuscator = AutoModel.from_pretrained('jwengr/gemma2-2b-kor-deobfuscation', trust_remote_code=True)
6hangul_deobfuscator.load_hangul_tokenizer(hangul_tokenizer)
7
8# Example
9text = '얀녕핥셈욧.'
10restored = hangul_deobfuscator.deobfuscate(text)
11print(restored) # '안녕하세요.'1from transformers import AutoModel
2
3# Load models
4hangul_tokenizer = AutoModel.from_pretrained('jwengr/gemma2-2b-kor-deobfuscation', subfolder='hangul_tokenizer', trust_remote_code=True)
5sentence_tokenizer = AutoModel.from_pretrained('jwengr/gemma2-2b-kor-deobfuscation', subfolder='sentence_tokenizer', trust_remote_code=True)
6hangul_deobfuscator = AutoModel.from_pretrained('jwengr/gemma2-2b-kor-deobfuscation', trust_remote_code=True)
7hangul_deobfuscator.load_hangul_tokenizer(hangul_tokenizer)
8
9# Example
10sentence = '''별 한 게토 았깝땀. 왜 싸람듯릭 펼 1캐를 쥰눈징 컥꺾폰 싸람믐롯섞 맒록 섧멍핥쟈닐 탯끎룐눈 녀뮤 퀼교... 야뭍툰 둠 변 닺씨 깍낄 싫훈 굣. 깸삥읊 20여 년 댜녁뵨 곧 중 쩨윌 귑푼 낙팠떤 곶.'''
11restored = hangul_deobfuscator.deobfuscate(sentence, sentence_tokenizer)
12print(restored)
13# '별 한 개도 아깝다. 왜 사람들이 별 1개를 주는지 겪어본 사람으로서 말로 설명하자니 댓글로는 너무 길고... 아무튼 두 번 다시 가길 싫은 곳. 캠핑을 20여 년 다녀본 곳 중 제일 기분 나빴던 곳.'1from transformers import AutoModel
2
3hangul_tokenizer = AutoModel.from_pretrained(
4 'jwengr/gemma2-2b-kor-deobfuscation',
5 subfolder='hangul_tokenizer',
6 trust_remote_code=True
7)
8
9encoded_ids, token_type_ids = hangul_tokenizer.encode_char('a안b녕c하d세e요!')
10decoded_text = hangul_tokenizer.decode_char(encoded_ids, token_type_ids)
11encoded_ids, token_type_ids = hangul_tokenizer.encode_jamo('a안b녕c하d세e요!')
12decoded_text = hangul_tokenizer.decode_jamo(encoded_ids, token_type_ids)
13print(decoded_text)
14# Output: 'a안b녕c하d세e요!'1from transformers import AutoModel
2
3sentence_tokenizer = AutoModel.from_pretrained(
4 'jwengr/gemma2-2b-kor-deobfuscation',
5 subfolder='sentence_tokenizer',
6 trust_remote_code=True
7)
8
9text = '''아... 가격 좋고 뷰도 뻥 뚫려서 시원하지만 담배 냄새 미쳐버림. 싸게 하루만 묵겠다! 하는 사람한테만 추천. 담배 냄새가 모든 장점을 가져가는 곳. 노래방에서 각종 담배와 유흥에 쩔었을 때 나는 냄새가 계속 방에 있음 ㅆ... 싸니까 할 말 없음.'''
10
11# 문장 분리
12chunks = sentence_tokenizer.split_text(text)
13print(chunks)
14# Output: [
15# '아... 가격 좋고 뷰도 뻥 뚫려서 시원하지만 담배 냄새 미쳐버림. 싸게 하루만 묵겠다! 하는 사람한테만 추천. ',
16# '담배 냄새가 모든 장점을 가져가는 곳. 노래방에서 각종 담배와 유흥에 쩔었을 때 나는 냄새가 계속 방에 있음 ',
17# 'ㅆ... 싸니까 할 말 없음.'
18# ]
19
20# 오버랩 적용
21chunks_overlapped = sentence_tokenizer.overlap(chunks)
22print(chunks_overlapped)
23# Output:
24# [
25# (0, 64, '아... 가격 좋고 뷰도 뻥 뚫려서 시원하지만 담배 냄새 미쳐버림. 싸게 하루만 묵겠다! 하는 사람한테만 추천.'),
26# (17, 86, '뚫려서 시원하지만 담배 냄새 미쳐버림. 싸게 하루만 묵겠다! 하는 사람한테만 추천. 담배 냄새가 모든 장점을 가져가는 곳.'),
27# (42, 109, '하루만 묵겠다! 하는 사람한테만 추천. 담배 냄새가 모든 장점을 가져가는 곳. 노래방에서 각종 담배와 유흥에 쩔었을 때'),
28# (64, 125, '담배 냄새가 모든 장점을 가져가는 곳. 노래방에서 각종 담배와 유흥에 쩔었을 때 나는 냄새가 계속 방에 있음'),
29# (86, 130, '노래방에서 각종 담배와 유흥에 쩔었을 때 나는 냄새가 계속 방에 있음 ㅆ...'),
30# (109, 134, '나는 냄새가 계속 방에 있음 ㅆ... 싸니까'),
31# (125, 141, 'ㅆ... 싸니까 할 말 없음.')
32# ]
33
34# 복원된 텍스트 출력
35decoded = sentence_tokenizer.decode_overlap(chunks_overlapped)
36print(decoded)
37# Output:
38# '아... 가격 좋고 뷰도 뻥 뚫려서 시원하지만 담배 냄새 미쳐버림. 싸게 하루만 묵겠다! 하는 사람한테만 추천. 담배 냄새가 모든 장점을 가져가는 곳. 노래방에서 각종 담배와 유흥에 쩔었을 때 나는 냄새가 계속 방에 있음 ㅆ... 싸니까 할 말 없음.'1from transformers import AutoModel
2
3hangul_augmentator = AutoModel.from_pretrained(
4 'jwengr/gemma2-2b-kor-deobfuscation',
5 subfolder='hangul_augmentator',
6 trust_remote_code=True
7)
8
9# 입력 문장
10text = '안녕하세요'
11
12# 난독화된 출력
13obfuscated = hangul_augmentator(text)
14print(obfuscated)
15# Output: '안녕함쒷오'