모델은
KRX LLM 경진대회 리더보드에서 우수상을 수상한 shibainu24 모델입니다. 모델은 금융, 회계 등 금융관련 지식에 대한 Text Generation을 제공합니다.
https://github.com/aiqwe/FinShibainu의 example을 참조하면 쉽게 inference를 해볼 수 있습니다.
대부분의 Inference는 RTX-3090 이상에서 단일 GPU 가능합니다.
1import pandas as pd
2from vllm import LLM
3
4inputs = [
5 "외환시장에서 일본 엔화와 미국 달러의 환율이 두 시장에서 약간의 차이를 보이고 있다. 이때 무위험 이익을 얻기 위한 적절한 거래 전략은 무엇인가?",
6 "신주인수권부사채(BW)에서 채권자가 신주인수권을 행사하지 않을 경우 어떤 일이 발생하는가?",
7 "공매도(Short Selling)에 대한 설명으로 옳지 않은 것은 무엇입니까?"
8]
9
10llm = LLM(model="aiqwe/krx-llm-competition", tensor_parallel_size=1)
11sampling_params = SamplingParams(temperature=0.7, max_tokens=128)
12outputs = llm.generate(inputs, sampling_params)
13for o in outputs:
14 print(o.prompt)
15 print(o.outputs[0].text)
16 print("*"*100)
Reference 데이터셋은 일부 저작권 관계로 인해 Link로 제공합니다.
MCQA와 QA 데이터셋은
https://huggingface.co/datasets/aiqwe/FinShibainu으로 공개합니다.
또한
https://github.com/aiqwe/FinShibainu를 이용하면 다양한 유틸리티 기능을 제공하며, 데이터 소싱 Pipeline을 참조할 수 있습니다.
MCQA 데이터는 Reference를 기반으로 다지선다형 문제를 생성한 데이터셋입니다. 문제와 답 뿐만 아니라 Reasoning 텍스트까지 생성하여 학습에 추가하였습니다.
학습에 사용된 데이터는 약 4.5만개 데이터셋이며, tiktoken의 o200k_base(gpt-4o, gpt-4o-mini Tokenizer)를 기준으로 총 2천만개의 토큰으로 학습되었습니다.
QA 데이터는 Reference와 질문을 함께 Input으로 받아 생성한 답변과 Reference 없이 질문만을 Input으로 받아 생성한 답변 2가지로 구성됩니다.
Reference를 제공받으면 모델은 보다 정확한 답변을 하지만 모델만의 지식이 제한되어 답변이 좀더 짧아지거나 다양성이 줄어들게 됩니다.
총 4.8만개의 데이터셋과 2억개의 토큰으로 학습되었습니다.
1@misc{jaylee2024finshibainu,
2 author = {Jay Lee},
3 title = {FinShibainu: Korean specified finance model},
4 year = {2024},
5 publisher = {GitHub},
6 journal = {GitHub repository},
7 url = {https://github.com/aiqwe/FinShibainu}
8}