Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base_model_id = "tokyotech-llm/Llama-3-Swallow-8B-Instruct-v0.1"
5adapter_id = "yadorigi/onomatopoeia-lora"
6
7tokenizer = AutoTokenizer.from_pretrained(base_model_id)
8base_model = AutoModelForCausalLM.from_pretrained(base_model_id)
9
10model = PeftModel.from_pretrained(base_model, adapter_id)
11Training Details
12Training Data
13
14本モデルは、音声からオノマトペを生成するために、以下の情報を統合したデータで学習されています。
15
16音イベントラベル(例: water, wind, footsteps)
17シーン情報(space, mood, intensity などの環境コンテキスト)
18日本語オノマトペ対応データ(擬音語・擬態語)
19
20これらを組み合わせることで、単純な音→ラベルではなく、
21文脈を含んだオノマトペ生成 を可能にしています。
22
23※データセットは独自に構築したものを使用しています。
24
25Training Procedure
26
27本モデルは PEFT(Parameter-Efficient Fine-Tuning)を用いた LoRA 学習で構築されています。
28
29LoRA fine-tuning(PEFT)
30条件付きプロンプトによる教師あり学習
31日本語オノマトペ表現に特化した最適化
32
33また、音響特徴とシーン情報を組み合わせることで、
34環境依存の表現生成(例:自然音 vs 都市音) に対応しています。
35
36Training Hyperparameters
37Training regime: bfloat16 mixed precision
38Fine-tuning method: LoRA (PEFT)
39
40※効率的な学習とGPUメモリ使用量の最適化を目的としています。
41
42Evaluation
43Evaluation Strategy
44
45本モデルは以下の複合的な評価手法により検証されています。
46
47人手評価(自然さ・音との一致度)
48コンテキスト整合性チェック(音環境との整合)
49LLMによる自己検証(self-consistency評価)
50Key Observations
51
52評価から以下の傾向が確認されています。
53
54単音イベント(例:足音、衝撃音)は高精度で生成可能
55環境音(風、水、雑踏など)は文脈依存性が高い
56「都市」と「自然」で出力の傾向が大きく変化する
57
58このため、入力コンテキストの質が出力品質に強く影響します。
59
60Technical Specifications
61Architecture
62Base model: Swallow-8B (Llama系)
63Adapter: LoRA
64Framework: Transformers + PEFT
65Compute
66GPU: NVIDIA A5000
67Precision: bfloat16
68Environmental Impact
69Hardware: NVIDIA A5000
70Training Time: 数時間〜数十時間(推定)
71Carbon Impact: 未測定
72
73※軽量なLoRA学習により、フルファインチューニングと比較して計算コストを削減しています。
74
75More Information
76
77本モデルは以下の生成パイプラインの一部として設計されています。
78
79Audio → Feature Extraction → Scene Interpretation → Onomatopoeia → Manga Generation
80
81音から視覚表現へ変換する一連のプロセスの中で、
82**「音の意味を言語化する中間レイヤー」**として機能します。
83
84## Dataset
85https://huggingface.co/datasets/yadorigi/Onomatopoeia_Dataset
86
87
88Contact
89
90yadorigi team