Dialog Corpus：用于训练中英文对话系统的语料库

推荐
23年2月27日
编辑

除夕

Dialog_Corpus：用于训练中英文对话系统的语料库/Datasets for Training Chatbot System，一个GitHub的项目，作者收集了一些从网络中找到的用于训练中文（英文）聊天机器人的对话语料，主要是一些公开的资料，ZCJUN小编看了一下有点年纪了，5年前，不过没关系，还是有效的，下面是目录，有需求的可以前往查阅。

中英文对话系统的语料库目录

dgk_shooter_min.conv.zip
中文电影对白语料，噪音比较大，许多对白问答关系没有对应好
The NUS SMS Corpus
包含中文和英文短信息语料，据说是世界最大公开的短消息语料
ChatterBot中文基本聊天语料
ChatterBot聊天引擎提供的一点基本中文聊天语料，量很少，但质量比较高
Datasets for Natural Language Processing
这是他人收集的自然语言处理相关数据集，主要包含Question Answering，Dialogue Systems， Goal-Oriented Dialogue Systems三部分，都是英文文本。可以使用机器翻译为中文，供中文对话使用
小黄鸡
据传这就是小黄鸡的语料：xiaohuangji50w_fenciA.conv.zip （已分词）和 xiaohuangji50w_nofenci.conv.zip （未分词）
白鹭时代中文问答语料
由白鹭时代官方论坛问答板块10,000+ 问题中，选择被标注了“最佳答案”的纪录汇总而成。人工review raw data，给每一个问题，一个可以接受的答案。目前，语料库只包含2907个问答。(备份)
Chat corpus repository
chat corpus collection from various open sources
包括：开放字幕、英文电影字幕、中文歌词、英文推文
保险行业QA语料库
通过翻译 insuranceQA产生的数据集。train_data含有问题12,889条，数据 141779条，正例：负例 = 1:10； test_data含有问题2,000条，数据 22000条，正例：负例 = 1:10；valid_data含有问题2,000条，数据 22000条，正例：负例 = 1:10

中英文对话系统的语料库地址

Dialog Corpus：https://github.com/candlewill/Dialog_Corpus

免责声明：

本站提供的资源，都来自网络，版权争议与本站无关，所有内容及软件的文章仅限用于学习和研究目的。不得将上述内容用于商业或者非法用途，否则，一切后果请用户自负，我们不保证内容的长久可用性，通过使用本站内容随之而来的风险与本站无关，您必须在下载后的24个小时之内，从您的电脑/手机中彻底删除上述内容。如果您喜欢该程序，请支持正版软件，购买注册，得到更好的正版服务。侵删请致信E-mail：i@zcjun.com