2017-05-11

GitHub - mdeff/fma: FMA: A Dataset For Music Analysis

https://github.com/mdeff/fma
The dataset is a dump of the Free Music Archive (FMA), an interactive library of high-quality, legal audio downloads.
Then, you got various sizes of MP3-encoded audio data:

1. fma_small.zip: 8,000 tracks of 30s, 8 balanced genres (GTZAN-like) (7.2 GiB)
2. fma_medium.zip: 25,000 tracks of 30s, 16 unbalanced genres (22 GiB)
3. fma_large.zip: 106,574 tracks of 30s, 161 unbalanced genres (93 GiB)
4. fma_full.zip: 106,574 untrimmed tracks, 161 unbalanced genres (879 GiB)

2017-05-01

京都大学ウェブ文書リードコーパス - KWDLC - KUROHASHI-KAWAHARA LAB

http://nlp.ist.i.kyoto-u.ac.jp/index.php?KWDLC

本コーパスは、さまざまなウェブ文書のリード(冒頭)3文に各種言語情報を人手で付与したテキストコーパスです。ウェブ文書のリード3文を収集することによって、ニュース記事、百科事典記事、ブログ、商用ページなど多様なジャンル、文体の文書を含んでいます。コーパスの規模は約5,000文書です。

言語情報としては、形態素・固有表現・構文・格関係、照応・省略関係、共参照、談話関係の情報を付与しています。談話関係以外の情報は、形態素解析システムJUMAN、構文・格・照応解析システムKNPで自動解析を行い、その結果を専門家が修正したものです。談話関係については、クラウドソーシングを利用して付与しています。

2017-04-26

Datasets · arXivTimes/arXivTimes Wiki · GitHub

https://github.com/arXivTimes/arXivTimes/wiki/Datasets

言語コーパスや画像・音声データセットのリンク。

2017-04-13

GitHub - visipedia/inat_comp: iNaturalist competition details

https://github.com/visipedia/inat_comp

There are a total of 5,089 categories in the dataset, with 579,184 training images and 95,986 validation images.
  • Training and validation images [186GB]
  • Training and validation annotations [26MB]
5,089個のカテゴリーの画像データセットをダウンロードできる。
画像の書庫サイズが 186 GBもある。

2017-03-19

雑談対話コーパス - 対話破綻検出チャレンジ

https://sites.google.com/site/dialoguebreakdowndetection/chat-dialogue-corpus
本コーパスはNTTドコモが一般公開している雑談対話APIを用いた雑談対話システムとユーザが21発話からなるやりとりを行った対話データで,116名の話者による1,146対話が収録されています.

2016-11-20

コーパス開発センター -Center for corpus development-

http://pj.ninjal.ac.jp/corpus_center/
国立国語研究所コーパス開発センターでは、日本語の全貌を把握するための言語コーパス (language corpus)を構築しています。

分類語彙表-増補改訂版データベース | 国立国語研究所

https://www.ninjal.ac.jp/archives/goihyo/
本データベース版は,書籍版の『分類語彙表 −増補改訂版−』の元となったデータを加工したものです。データベースソフトに取り込めるようCSV形式になっています。レコード総数は,101,070件です
http://pj.ninjal.ac.jp/corpus_center/files/bunruidb.zip
分類語彙表増補改訂版データベース
著 者: 国立国語研究所(編)
2004年公開

2016-07-09

The Stanford Question Answering Dataset

https://stanford-qa.com/
Stanford Question Answering Dataset (SQuAD) is a reading comprehension dataset, consisting of questions posed by crowdworkers on a set of Wikipedia articles, where the answer to every question is a segment of text, or span, from the corresponding reading passage. With 107,785 question-answer pairs on 536 articles, SQuAD is significantly larger than previous reading comprehension datasets.
質問応答データセット。

2016-03-03

GitHub - tomorinao/corpus: 友利奈緒の全セリフデータ

https://github.com/tomorinao/corpus
Charlotteのアニメにおける友利奈緒のセリフをまとめました

2016-01-16

R10 - Yahoo News Feed dataset, version 1.0 (1.5TB)

http://webscope.sandbox.yahoo.com/catalog.php?datatype=r&did=75
The dataset stands at a massive ~110B lines (1.5TB bzipped) of user-news item interaction data, collected by recording the user- news item interaction of about 20M users from February 2015 to May 2015.

2017-05-11 追記
"This Dataset is no longer available" となっている。