许可证: MIT
微件示例:
- 文本: "오늘 아침 정부는 발표를 통해"
- 文本: "아 배고프다"
数据集:
- heegyu/korean-petitions
- heegyu/namuwiki-extracted
- heegyu/kowikitext
语言:
- ko
管道标签: text-generation
模型架构
- GPT-J(Flax, Pytorch)
- 20层, 1024隐藏维度, 4096中间层, 16头注意力, 51200词表大小
- 最大序列长度1024
- 参数量: 3.5亿
性能基准

训练环境与超参数
- TPU V2-8
- 学习率: 3e-4, 批大小: 512(=64梯度累积×8设备), 调度器: 线性, 预热步数: 1000
- adam_beta1=0.9, adam_beta2=0.98, 权重衰减=0.01
- 训练步数: 43247(3轮)
- 训练token数: 211.1亿(43247×512×1024序列/1024^3)
- 训练周期: 2023/1/25~2023/1/29
训练数据
- AIHub SNS对话(730MB)
- AIHub口语语料(422MB)
- AIHub书籍(1.6MB)
- AIHub大规模网络韩语语料(12GB)
- 韩语维基(867MB)
- 纳木维基(6.4GB)
- 国立国语院即时通讯对话(21MB)
- 国立国语院日常对话语料(23MB)
- 国立国语院书面语料(3.2GB)
- 国立国语院口语语料(1.1GB)
- 国立国语院新闻语料(~2022年,17GB)
- 青瓦台国民请愿(525MB)
数据规模以预处理后的jsonl文件为准,总token数约70亿。
使用示例
from transformers import pipeline
model_name = "heegyu/kogpt-j-350m"
pipe = pipeline('text-generation', model=model_name)
print(pipe("안녕하세요", repetition_penalty=1.2, do_sample=True, eos_token_id=1, early_stopping=True, max_new_tokens=128))
print(pipe("오늘 정부 발표에 따르면, ", repetition_penalty=1.2, do_sample=True, eos_token_id=1, early_stopping=True, max_new_tokens=128))
print(pipe("싸늘하다. 가슴에 비수가 날아와 꽂힌다. ", repetition_penalty=1.2, do_sample=True, eos_token_id=1, early_stopping=True, max_new_tokens=128, min_length=64))
输出结果:
[{'generated_text': '안녕하세요?\n네.\n자~ 오늘 그~ 뭐~ 남북정상회담에서 인제 남북 관계와 관련된 발언이죠?\n예. 그렇습니다.\n어~ 그~ 이산가족 문제 관련해서 이산가족 상봉을\n예.\n하는 방안이 좀 가능성이 있지 않아요?\n상당히 가능성이 있죠.\n예. 이~ 구체적으로 어떤 거였나요?\n어~ 먼저 이산가족 상봉을 이제 말씀드리겠습니다.\n예.\n아까 설명드린 것처럼 그~ 이산가족 상\n네.\n그~ 상봉에 대한 그~ 구체적인 방안이 어떻게 결정되는 게 가장 좋을까요?\n우선 상봉 방법부터 얘기를 드리죠.\n'}]
[{'generated_text': '오늘 정부 발표에 따르면, gtx-d d 노선을 창릉과 수서에서 출발하는 등 당초 예정된 노선들을 모두 정차하기로 했다. 지난 2월 국토교통부가 이 노선을 일산·금정·파주 운정역과 직접 연결키로 하면서 일산~동탄, 일산~분당, 일산~양재 구간에 추가 정차할 것이라는 예상이 나왔지만 실제 일산~수서 구간이 정차하기로 확정됐다. gtx-d 노선이 일산~수서역까지 개통되는 것은 이번이 처음이다.. gtx-d 노선과 gtx-a 노선이 모두 개통되면 지하철 5호선의 서울 도심 통과 구간이 추가된다. 현재 gtx-b'}]
[{'generated_text': '싸늘하다. 가슴에 비수가 날아와 꽂힌다. \U000f0854삼국사절요\U000f0855 ‘화살촉이 울버린’의 경우에서 보면, 총소리의 원음은 鐘(종자용 : 송악), 鐘을 비(鐘)라 하고 종자의 발음은 ‘이( )’이다. 이때에서 ‘이(은)로 시작하는 발음’은 ‘이/이’의 음운적 표현이다. ‘이/은→종자용[鐘] → 송악/종자[鐘]→이→종자(鐘) …’이다. 이는 한자어로서 그 발음'}]
注意事项
本模型训练数据可能包含各类歧视/仇恨内容,且未进行专门过滤。因此模型生成的文本可能出现针对特定人物、种族、性别或残障人士的歧视/仇恨言论。