本コーパスはNTTドコモが一般公開している雑談対話APIを用いた雑談対話システムとユーザが21発話からなるやりとりを行った対話データで,116名の話者による1,146対話が収録されています.
2017-03-19
雑談対話コーパス - 対話破綻検出チャレンジ
https://sites.google.com/site/dialoguebreakdowndetection/chat-dialogue-corpus
2016-11-20
コーパス開発センター -Center for corpus development-
http://pj.ninjal.ac.jp/corpus_center/
国立国語研究所コーパス開発センターでは、日本語の全貌を把握するための言語コーパス (language corpus)を構築しています。
分類語彙表-増補改訂版データベース | 国立国語研究所
https://www.ninjal.ac.jp/archives/goihyo/
本データベース版は,書籍版の『分類語彙表 −増補改訂版−』の元となったデータを加工したものです。データベースソフトに取り込めるようCSV形式になっています。レコード総数は,101,070件ですhttp://pj.ninjal.ac.jp/corpus_center/files/bunruidb.zip
分類語彙表増補改訂版データベース
著 者: 国立国語研究所(編)
2004年公開
2016-07-09
The Stanford Question Answering Dataset
https://stanford-qa.com/
Stanford Question Answering Dataset (SQuAD) is a reading comprehension dataset, consisting of questions posed by crowdworkers on a set of Wikipedia articles, where the answer to every question is a segment of text, or span, from the corresponding reading passage. With 107,785 question-answer pairs on 536 articles, SQuAD is significantly larger than previous reading comprehension datasets.質問応答データセット。
2016-03-03
2016-01-16
R10 - Yahoo News Feed dataset, version 1.0 (1.5TB)
http://webscope.sandbox.yahoo.com/catalog.php?datatype=r&did=75
The dataset stands at a massive ~110B lines (1.5TB bzipped) of user-news item interaction data, collected by recording the user- news item interaction of about 20M users from February 2015 to May 2015.
2017-05-11 追記
"This Dataset is no longer available" となっている。
2015-11-21
N-gram コーパス - 日本語ウェブコーパス 2010
http://s-yata.jp/corpus/nwc2010/ngrams/
概要https://twitter.com/s5yata/status/667887920817111040
ウェブページに出現する形態素 N-gram と文字 N-gram を頻度とともに収録したコーパスです.各 N-gram コーパスには,頻度 10/100/1000 以上の 1-gram から 7-gram までが収録されています.
s-yata.jp/corpus/nwc2010... の N-gram コーパスを Google Drive にアップロードしてみました.https://drive.google.com/folderview?id=0B0oLhpFvWG_sbmdyVk53U0ZnQ0E&usp=sharing
2015-10-30
Translation Task - EMNLP 2011 Sixth Workshop on Statistical Machine Translation
http://statmt.org/wmt11/translation-task.html
The recurring translation task of the WMT workshops focuses on European language pairs. Translation quality will be evaluated on a shared, unseen test set of news stories. We provide a parallel corpus as training data, a baseline system, and additional resources for download.
Wikipedia日英京都関連文書対訳コーパス
https://alaginrc.nict.go.jp/WikiCorpus/
『Wikipedia日英京都関連文書対訳コーパス』は、高性能な多言語翻訳、情報抽出システム等の構築を支援することを目的に作成された日英対訳コーパスです。国立研究開発法人情報通信研究機構がWikipediaの日本語記事(京都関連)を英語に翻訳し、作成しました。