[
  {
    "questionId": "99e78c390932594bd833be0f5c890af5c605d808",
    "paperId": "1912.04961",
    "question": "What is the baseline?",
    "inputSha256": "e878cc5d484ccba1fce0c578e98efdfadf1876ee88532bf8a122a51fc1818f82",
    "evidenceSetSha256": [
      "a5fe8d355cf593dc05aff28300d5f8a2839562dbb179953e451c8749b63f3543"
    ],
    "inputTokensBpe": 6821,
    "evidencePosition": "middle"
  },
  {
    "questionId": "54830abe73fef4e629a36866ceeeca10214bd2c8",
    "paperId": "1909.09551",
    "question": "How they utilize LDA and Gibbs sampling to evaluate ISWC and WWW publications?",
    "inputSha256": "6ab976b2923dde613a0ab06aa34c7443b5ba3d70f68e68d4fb1914467993e60e",
    "evidenceSetSha256": [
      "c7f4bb040df2884a103cbc8d2ad419b997292a42ca76897599787257934944f6",
      "de81b365f31042d6ccd971d668efd507deabb115b9f946aa4152e46b4542463a"
    ],
    "inputTokensBpe": 7175,
    "evidencePosition": "front"
  },
  {
    "questionId": "0682bf049f96fa603d50f0fdad0b79a5c55f6c97",
    "paperId": "2003.03014",
    "question": "Do they analyze specific derogatory words?",
    "inputSha256": "a67bdb0ad625fc7091d4b9424bf44abacf84630f7583d53bd8efa4608c6ec5b6",
    "evidenceSetSha256": [
      "542dc1b5d4c5e86bc49121265ca2a11ab01e1f3deccb721c35218334a9417952"
    ],
    "inputTokensBpe": 18428,
    "evidencePosition": "middle"
  },
  {
    "questionId": "f9aa055bf73185ba939dfb03454384810eb17ad1",
    "paperId": "2002.07306",
    "question": "How much training data from the non-English language is used by the system?",
    "inputSha256": "631e3fe10c0ee4bf687be8a4ccdbac0c5b4e8a517a9a571ea6c08363508f56ad",
    "evidenceSetSha256": [
      "5c8822ec3de54a7ceffd81421ddea64743b6a0035606a94fac90089baf9719d0"
    ],
    "inputTokensBpe": 5632,
    "evidencePosition": "front"
  },
  {
    "questionId": "3355918bbdccac644afe441f085d0ffbbad565d7",
    "paperId": "2001.01269",
    "question": "How are the supervised scores of the words calculated?",
    "inputSha256": "3037c0af0874a247465e1f976d109ed9a4726b5d47ef9f93d38a0885e60d6426",
    "evidenceSetSha256": [
      "9a203e7a927c0cb2cbc46467389ee0de1cc8c4d3cd18574e7fdc6e48970188a2"
    ],
    "inputTokensBpe": 5327,
    "evidencePosition": "middle"
  },
  {
    "questionId": "932b39fd6c47c6a880621a62e6a978491d881d60",
    "paperId": "1611.08661",
    "question": "What baselines are used for comparison?",
    "inputSha256": "48ef9997cf16fc6ac03f9e9e61e6865e98eb486f2807b444181fefef9678f9ef",
    "evidenceSetSha256": [
      "a514e26d36cdd56a991089c4537ec289fbb498f7992ba2ba69141ba0f29b4c57"
    ],
    "inputTokensBpe": 5593,
    "evidencePosition": "back"
  },
  {
    "questionId": "dd76130ec5fac477123fe8880472d03fbafddef6",
    "paperId": "1705.01214",
    "question": "What is the state of the art described in the paper?",
    "inputSha256": "c53df1e74e9d8c469c0130990e036a5a9537977b86ff524d16b2c087a305754b",
    "evidenceSetSha256": [
      "ac5d6200c58867c7537575032405724962cf291426230100faf10da94c09f62f"
    ],
    "inputTokensBpe": 19272,
    "evidencePosition": "front"
  },
  {
    "questionId": "92294820ac0d9421f086139e816354970f066d8a",
    "paperId": "1910.06036",
    "question": "How big are significant improvements?",
    "inputSha256": "be477d2dd2fce982067d85d534544f75ade3e4bc288c046a6d0f5895f8381522",
    "evidenceSetSha256": [
      "7115d07642f1529e5f6f91c9ad1a841f39e560e8f5217e6c23e6dd0947daa0b3"
    ],
    "inputTokensBpe": 6030,
    "evidencePosition": "back"
  },
  {
    "questionId": "52f9cd05d8312ae3c7a43689804bac63f7cac34b",
    "paperId": "1809.03449",
    "question": "Do the authors hypothesize that humans' robustness to noise is due to their general knowledge?",
    "inputSha256": "a0a3ef20e627775a869ca47992ae4fc053f04ce78c82aeaa72cee0c17ec55f13",
    "evidenceSetSha256": [
      "e8cc408268a8cb2801d069b28d2cba766b7d8aa13c29fbfb628f042d41cbdf24",
      "fa14532693dda61ad183586cffc80ba776b375455c25f5debd6f1fc231d0bdfa"
    ],
    "inputTokensBpe": 5912,
    "evidencePosition": "front"
  },
  {
    "questionId": "2a6003a74d051d0ebbe62e8883533a5f5e55078b",
    "paperId": "1702.03342",
    "question": "which neural embedding model works better?",
    "inputSha256": "c1802d9a4e1e5140463f0f892446dd73221cfb007336cc386ab5418ef95ba578",
    "evidenceSetSha256": [
      "f9f7035220763c75cb264a4533ee1d37d07f5ef6249acee3d9485e0ce294f414"
    ],
    "inputTokensBpe": 5680,
    "evidencePosition": "back"
  },
  {
    "questionId": "37f8c034a14c7b4d0ab2e0ed1b827cc0eaa71ac6",
    "paperId": "2002.07306",
    "question": "What metrics are used for evaluation?",
    "inputSha256": "631e3fe10c0ee4bf687be8a4ccdbac0c5b4e8a517a9a571ea6c08363508f56ad",
    "evidenceSetSha256": [
      "06c0f27fda8749a67f2f3db5b43e032d2997bb390e6f4b3702ddaec96087edf2",
      "6d583abdcecd95cb36c44aac31a5512785f20eca3256efb192f474447c7243aa"
    ],
    "inputTokensBpe": 5632,
    "evidencePosition": "middle"
  },
  {
    "questionId": "48bd71477d5f89333fa7ce5c4556e4d950fb16ed",
    "paperId": "2002.01207",
    "question": "what surface-level features are used?",
    "inputSha256": "9caa961ae1679f698cf5bbbc1da744532b7e477fe540bef2ebc2caa8439d70a9",
    "evidenceSetSha256": [
      "ecb3baf460079c367c88a2264d07f30c37132847d43faa04399b86c8d9f32097"
    ],
    "inputTokensBpe": 7464,
    "evidencePosition": "middle"
  },
  {
    "questionId": "249c805ee6f2ebe4dbc972126b3d82fb09fa3556",
    "paperId": "1908.04042",
    "question": "how is diversity measured?",
    "inputSha256": "606e911f4cc99b2ef6615584178edab0087d94daf53ad50881d486933b940d80",
    "evidenceSetSha256": [
      "12737a33331b2fae57396c63fa1f79347dabd102dd84f8211ccbc9823aaedec1",
      "de3f3b0ceca434b3d92d28368937c8d2d9821b3ee0dec5573721b409dcae18d4"
    ],
    "inputTokensBpe": 4644,
    "evidencePosition": "middle"
  },
  {
    "questionId": "9eabb54c2408dac24f00f92cf1061258c7ea2e1a",
    "paperId": "1909.09067",
    "question": "Which information about text structure is included in the corpus?",
    "inputSha256": "840737d1752663622c60bae3dd9ac0ffff5e990f34ef7c862a8ae6ddb1331a72",
    "evidenceSetSha256": [
      "bd115cd8cb6138e2661af2a84e9c2cda6f29669f373347315903d4e9d901e373"
    ],
    "inputTokensBpe": 4193,
    "evidencePosition": "front"
  },
  {
    "questionId": "b9ea841b817ba23281c95c7a769873b840dee8d5",
    "paperId": "1805.07133",
    "question": "did they collect their own data?",
    "inputSha256": "9646131565ab10fe8bca647db426cf0093c7f2399063394ce9931fdcdcf7bcc1",
    "evidenceSetSha256": [
      "6e25303707e58410041a84523cba7d91a36fbb8e40c3cd3b4cb23f36e03841f4"
    ],
    "inputTokensBpe": 5747,
    "evidencePosition": "back"
  },
  {
    "questionId": "e44a6bf67ce3fde0c6608b150030e44d87eb25e3",
    "paperId": "1611.03599",
    "question": "What topics are included in the debate data?",
    "inputSha256": "a41d06e4a4ea42c00aeb9b98882467a7002b51f4591a440664fa6b16b093fb1e",
    "evidenceSetSha256": [
      "03a37283db7ada358e7059869e5a8ffe6aaf7d8da0f47066c280f83954a81847",
      "d42a748da2dda34498d5234242301cf8e3e746f5ab86665d984e85659ec863c6"
    ],
    "inputTokensBpe": 6224,
    "evidencePosition": "middle"
  },
  {
    "questionId": "6aa2a1e2e3666f2b2a1f282d4cbdd1ca325eb9de",
    "paperId": "1809.00530",
    "question": "How many labels do the datasets have?",
    "inputSha256": "a579c4defd04c11fc53ab5ace3e139a9a4e2e5a7238f3c57f5087d3ab2af0484",
    "evidenceSetSha256": [
      "9cd0e1ca36aa33af7cf0e059407226704bba6582d9c4c6a889d2c70bc2ee85f1"
    ],
    "inputTokensBpe": 7050,
    "evidencePosition": "middle"
  },
  {
    "questionId": "a253749e3b4c4f340778235f640ce694642a4555",
    "paperId": "1908.08717",
    "question": "Which corpora does this paper analyse?",
    "inputSha256": "09b3e11529d737592db9428805d4b7cd45491fc272e28d06cbb8ae667ef4bfbc",
    "evidenceSetSha256": [
      "98c966c2addf1ba83dd30ba4dea709f6859742fb2ffe7c2bd70b318ac5179b80",
      "bbb3598491fa03d90fb49f53d56a56c796ccc133fb6394b0840bc5db5877eb52"
    ],
    "inputTokensBpe": 5574,
    "evidencePosition": "middle"
  },
  {
    "questionId": "6a31db1aca57a818f36bba9002561724655372a7",
    "paperId": "1611.03599",
    "question": "What is the size of the Chinese data?",
    "inputSha256": "a41d06e4a4ea42c00aeb9b98882467a7002b51f4591a440664fa6b16b093fb1e",
    "evidenceSetSha256": [
      "a4882f6c39995ef073f7d406fa5de71494ecdbceeeace9fe5135e29779962d85",
      "094acadc7326420357551451511d2dc1723e28a6cac297eab80b9d41f271ac60"
    ],
    "inputTokensBpe": 6224,
    "evidencePosition": "middle"
  },
  {
    "questionId": "0602a974a879e6eae223cdf048410b5a0111665e",
    "paperId": "1908.09246",
    "question": "What baseline approaches does this approach out-perform?",
    "inputSha256": "d689a252b518eee19de74d7dfac9032c99d43e9c5e5c9937d7e19bf189ac788f",
    "evidenceSetSha256": [
      "99973973deb9e7f54c1b41488307ce207b1f3fa3e308646a291f4ba177990e8a"
    ],
    "inputTokensBpe": 5769,
    "evidencePosition": "back"
  },
  {
    "questionId": "5c5aeee83ea3b34f5936404f5855ccb9869356c1",
    "paperId": "1909.00015",
    "question": "What tasks are used for evaluation?",
    "inputSha256": "e2116968306a3c4d54a635c3fca6df24d69760cb7cecd50c9655c3bda1f9c7cf",
    "evidenceSetSha256": [
      "fecef078e47111be12898166a895d8ccb3e73dd4d09d2638c0b5e308b6ae7565",
      "a5592d10fa60bc2722653bb1018d2c577c279103a2e165bbf01750da1052e28b"
    ],
    "inputTokensBpe": 10009,
    "evidencePosition": "front"
  },
  {
    "questionId": "66c96c297c2cffdf5013bab5e95b59101cb38655",
    "paperId": "2003.03106",
    "question": "What is the performance of BERT on the task?",
    "inputSha256": "1f5c5ecf7bf48acdca56816516d946ee79419bc5820050660cf4cbb6bf77110a",
    "evidenceSetSha256": [
      "a5b8e189fe5e387b030af4ddd6e3e4db6c3d408545e2fb012e87ef083d83b413",
      "c34f978d1ec6e6e34c2e02ed001ad0e5232c5d08eac98108d42ec96f6110b427"
    ],
    "inputTokensBpe": 6723,
    "evidencePosition": "back"
  },
  {
    "questionId": "d67c01d9b689c052045f3de1b0918bab18c3f174",
    "paperId": "1610.00956",
    "question": "How large are the improvements of the Attention-Sum Reader model when using the BookTest dataset?",
    "inputSha256": "7d2e15dd94d2abdeb303c4e44f104bc119c142326f307f55965acd977dfb6ec3",
    "evidenceSetSha256": [
      "ea7c2deafe6cb93c055838b7170bb3f9569ad770a1e01b1aecd2a03387b2c72e",
      "03f209a4af2ca6d26bf2a4741dd8c87f78b10b4bfe8fb527e6676a78c01d5faf"
    ],
    "inputTokensBpe": 5504,
    "evidencePosition": "back"
  },
  {
    "questionId": "dca86fbe1d57b44986055b282a03c15ef7882e51",
    "paperId": "1712.05999",
    "question": "How is the ground truth for fake news established?",
    "inputSha256": "7f39a463582528535e9b6312df05c8e679a29dbcc617661fced409f17e14197f",
    "evidenceSetSha256": [
      "5f447f51939fb384ca6d61b30d4d63d4f2187abcee69eb036817e0fd1dec5d11"
    ],
    "inputTokensBpe": 4141,
    "evidencePosition": "middle"
  },
  {
    "questionId": "0ad4359e3e7e5e5f261c2668fe84c12bc762b3b8",
    "paperId": "1809.02286",
    "question": "Which baselines did they compare against?",
    "inputSha256": "086ea66b0e56b1f3085c1cc7da50cbb81dfb6973ba4642cd30d4cc8cd0648e13",
    "evidenceSetSha256": [
      "64777461582f066a20dd831f82ade9bf83318eb8ebf0af7ee7babbad1cebe052",
      "5adb6268a658b65e037e2b92390fa5748b85adcbbff9025187ed771b8f7de136"
    ],
    "inputTokensBpe": 8454,
    "evidencePosition": "back"
  },
  {
    "questionId": "bdf93053b1b9b0a21f77ed370cf4d5a10df70e3e",
    "paperId": "1706.01875",
    "question": "What was their system's performance?",
    "inputSha256": "9d462898c833d06a008b059d07d6cfe950a0f48d02b3a993701a44f858ecca53",
    "evidenceSetSha256": [
      "23a0542e8b855a6dda12566bf33c65b0dfc5e6384d425d1e9078effe3d1ba14e",
      "6ae2c81fca6aac81dfb7e9008efde25139af3272bfd4069c621281c00ae87d03"
    ],
    "inputTokensBpe": 4580,
    "evidencePosition": "middle"
  },
  {
    "questionId": "5eda469a8a77f028d0c5f1acd296111085614537",
    "paperId": "1912.01214",
    "question": "what language pairs are explored?",
    "inputSha256": "eaa95369a3177e1b871637522002f52044f43bf9b7d46a95b33a86ef378c3ad2",
    "evidenceSetSha256": [
      "57da518667330fedfe6a5afdef1f7a2d9c872d717cd062ddaa074c45c791ed41",
      "034896e8d340f158dcd1b1237595f31fce29900cb63f41a035b33b4a02990c93"
    ],
    "inputTokensBpe": 5735,
    "evidencePosition": "middle"
  },
  {
    "questionId": "f59f1f5b528a2eec5cfb1e49c87699e0c536cc45",
    "paperId": "1908.05828",
    "question": "How big is the new Nepali NER dataset?",
    "inputSha256": "d569d8bcf7c7badb620063bf4095134edb3f15a158b28ba83c0de5ee917a4ae2",
    "evidenceSetSha256": [
      "1c63b0fe4b730db9b1683b777a2bf0d85bf1b149c0e4be322ad1e2d47f2447cd"
    ],
    "inputTokensBpe": 4469,
    "evidencePosition": "middle"
  },
  {
    "questionId": "692c9c5d9ff9cd3e0ce8b5e4fa68dda9bd23dec1",
    "paperId": "1612.08205",
    "question": "How many users do they look at?",
    "inputSha256": "553d4b2679ac677520a67fb883f2c8de5d343ef7aeac059cc8afbd1c0e9f6cdf",
    "evidenceSetSha256": [
      "9675282af7be2687c52e593e1ed51aaf4c186673fe78e2eb14a6cd2ae4fcc9c9",
      "bd5ce374a97aab869bc80442645f8103e5524910d39b71e05028ff3b3a740a18"
    ],
    "inputTokensBpe": 5487,
    "evidencePosition": "front"
  },
  {
    "questionId": "74e866137b3452ec50fb6feaf5753c8637459e62",
    "paperId": "1604.00400",
    "question": "What manual Pyramid scores are used?",
    "inputSha256": "7a3316f2e9811bad64d113fcb78e87cb6a30715eb6ee794318547a472a7cd705",
    "evidenceSetSha256": [
      "a63e4927974a00936f152085b9e8328171773c12b2c2acee2caa502f0ac1c221",
      "41e35c21b01fea411fde70a07d9119b5506b13141090db8aa458bf9a315a00d2"
    ],
    "inputTokensBpe": 6877,
    "evidencePosition": "middle"
  },
  {
    "questionId": "fb5fb11e7d01b9f9efe3db3417b8faf4f8d6931f",
    "paperId": "1810.12196",
    "question": "What baselines are presented?",
    "inputSha256": "bbcf20b2b701e6ad9915b340ec4f5a85f0eb11361301ae8d7ed89db5d819e922",
    "evidenceSetSha256": [
      "bf16c9f41d85328a0847e5f5ab21545d9e1a248a56eb6ef802b2acb5e5ede695",
      "2acef48f320685c92be7a8b4ddf2f72b492f1790fefa55692254dedcce7a3b9b"
    ],
    "inputTokensBpe": 4969,
    "evidencePosition": "back"
  },
  {
    "questionId": "dc2a2c177cd5df6da5d03e6e74262bf424850ec9",
    "paperId": "2002.12612",
    "question": "How is the political bias of different sources included in the model?",
    "inputSha256": "8038046129fc190245f94020857c90a115ffaeafbe1009c45ea5100bf5d13559",
    "evidenceSetSha256": [
      "630428c8d309c59740f27417bed29b4cce99fa7673c069bb1769428030c4b687",
      "33610a8ddd9576ad8f18c9fafb56452cf7e1bba85cd830900b6cf0b3c6376400"
    ],
    "inputTokensBpe": 7095,
    "evidencePosition": "front"
  },
  {
    "questionId": "a29c071065d26e5ee3c3bcd877e7f215c59d1d33",
    "paperId": "1908.10084",
    "question": "What metrics are used for the STS tasks?",
    "inputSha256": "93d97c33a329d46219104cbc7f30d5f72b727ecc9e65daa009428b236c2a5c54",
    "evidenceSetSha256": [
      "2e71e8018e4d080939cf9a0434ae7805b32e5c4ff10442f50d2e70521181bdb5",
      "289dcc54d4e006bdf074d6d3860ccefc39cc593947f6813b30cfb3b3dd6d9593"
    ],
    "inputTokensBpe": 6061,
    "evidencePosition": "middle"
  },
  {
    "questionId": "5cc2daca2a84ddccba9cdd9449e51bb3f64b3dde",
    "paperId": "1912.01772",
    "question": "What are the models used for the baseline of the three NLP tasks?",
    "inputSha256": "c1d695e7d89ddfadbc98e90e976b0fd38645a105e4be954fd3e3c081dc5fb7f8",
    "evidenceSetSha256": [
      "a160685def8d5b5681460c46bad78bdb253a4a9fe010cb049e12c0fbae520e03",
      "9c087a1f50e3a586bfbc1a283adcc134dc54251edfcf07cce101d2b18bb957e6"
    ],
    "inputTokensBpe": 4300,
    "evidencePosition": "back"
  },
  {
    "questionId": "5a22293b055f5775081d6acdc0450f7bd5f5de04",
    "paperId": "1909.02304",
    "question": "What is the state-of-the-art model for the task?",
    "inputSha256": "531859c827cd258d9119684291207a5f6a421f0ce5bd1a122db12b5f4fd2639d",
    "evidenceSetSha256": [
      "e8a10968483fd2df3e78f45fe469d0ea650970187a6208bf05338b0406c8e22a"
    ],
    "inputTokensBpe": 7918,
    "evidencePosition": "middle"
  },
  {
    "questionId": "23e2971c962bb6486bc0a66ff04242170dd22a1d",
    "paperId": "1901.01010",
    "question": "Which is more useful, visual or textual features?",
    "inputSha256": "9c05d4692b345f5527c8d1fbcc72f215b6bebaa9ff89fc4282110e4bc4c2f26f",
    "evidenceSetSha256": [
      "555aad9febfc6841159d4d033a67e22fa786370915fdf91c1e9923f92ab974a9"
    ],
    "inputTokensBpe": 5893,
    "evidencePosition": "back"
  },
  {
    "questionId": "c571deefe93f0a41b60f9886db119947648e967c",
    "paperId": "1810.12085",
    "question": "what datasets were used?",
    "inputSha256": "3bfbf2e1bb6568c9cc6edfd9cbab028690a838d22a9112fcd2b3d6d448538b9c",
    "evidenceSetSha256": [
      "f0102d6c41a310caf6fa10b260e531f300a13719a0afd40eb8447e29ec5c2539",
      "0cb244ceb4660410c584e28d093173508f9d76707f69bdcc25d985408088dbd3"
    ],
    "inputTokensBpe": 4161,
    "evidencePosition": "front"
  },
  {
    "questionId": "612c3675b6c55b60ae6d24265ed8e20f62cb117e",
    "paperId": "2003.08385",
    "question": "Did they pefrorm any cross-lingual vs single language evaluation?",
    "inputSha256": "0270d24089dd0c9106233485aa90d632dd1054f6bed6212f485723b411af7cc4",
    "evidenceSetSha256": [
      "7d0afe959d086f5b78137960adea4b407b47b17766a91a14ec859b564acfbcd2"
    ],
    "inputTokensBpe": 5671,
    "evidencePosition": "back"
  },
  {
    "questionId": "70148c8d0f345ea36200d5ba19d021924d98e759",
    "paperId": "1906.01040",
    "question": "What is the McGurk effect?",
    "inputSha256": "12a4b022055114c3c5aa370d61d53ffec11883a410b5233bd284c07d0447a338",
    "evidenceSetSha256": [
      "d4353b0a22018ab4b9bc35706ea61de4d0535dfe3db619d403d9ac225193fb46",
      "f9c6031da352632566ac9d7526285add5a157ccc99a3de940c2ddb99ae1740a7"
    ],
    "inputTokensBpe": 4693,
    "evidencePosition": "front"
  },
  {
    "questionId": "67e9e147b2cab5ba43572ce8a17fc863690172f0",
    "paperId": "1912.00667",
    "question": "How are the interpretability merits of the approach demonstrated?",
    "inputSha256": "8878b9ca3f107ff51659920b66ed895d4c5b623f8769c8c458cfff10c9caa156",
    "evidenceSetSha256": [
      "895c5c1911267c0c70ef4164d38dda0b657f48e8e64592ccf96a3a3bd5290487",
      "94d2e946b84edac28e01e4ea49c6d9ea0435093a22ab834515c7a1f740d5398b"
    ],
    "inputTokensBpe": 7173,
    "evidencePosition": "back"
  },
  {
    "questionId": "e025061e199b121f2ac8f3d9637d9bf987d65cd5",
    "paperId": "1712.00991",
    "question": "What is the average length of the sentences?",
    "inputSha256": "766b3260b82e18a919b5bab5e2e75c250c3893701cf95dfbac6f36834165b070",
    "evidenceSetSha256": [
      "d82dceaaacc917301d51b16e4358bedbf4817bfc44680b7803b31f4089328c99",
      "90245e93e8b47bd02a91d54ced03fde64ad69ec420faadaa97f97e8d158a1d1e"
    ],
    "inputTokensBpe": 4556,
    "evidencePosition": "middle"
  },
  {
    "questionId": "2236386729105f5cf42f73cc055ce3acdea2d452",
    "paperId": "1810.12196",
    "question": "What language are the reviews in?",
    "inputSha256": "bbcf20b2b701e6ad9915b340ec4f5a85f0eb11361301ae8d7ed89db5d819e922",
    "evidenceSetSha256": [
      "390bdda54a425e9861bb878c337fdea69e7baa93a5f37a1eef25dd84dd2dc11d"
    ],
    "inputTokensBpe": 4969,
    "evidencePosition": "back"
  },
  {
    "questionId": "56a8826cbee49560592b2d4b47b18ada236a12b9",
    "paperId": "1712.05999",
    "question": "How did they determine fake news tweets?",
    "inputSha256": "7f39a463582528535e9b6312df05c8e679a29dbcc617661fced409f17e14197f",
    "evidenceSetSha256": [
      "d51cfff91c89ca3b2944be2396e63a75c227df836bdc7db17cab7d40aec2c02e",
      "055842063b2d20f80456f3fc3ab08694d994681fbfb9aee30bd5a7f11c2d1381"
    ],
    "inputTokensBpe": 4141,
    "evidencePosition": "front"
  },
  {
    "questionId": "984fc3e726848f8f13dfe72b89e3770d00c3a1af",
    "paperId": "1703.10344",
    "question": "What features are used to represent the novelty of news articles to entity pages?",
    "inputSha256": "7421b6b4793684b7097b3ce150fbaad718dd921cf3664a3bc0985e6a5fd1266a",
    "evidenceSetSha256": [
      "7ac68636469762c0445fc445badb76d05a1042b6941728e45e24a6ac02143bb3",
      "f7935f5fa5f796dd13e5fbffd670a13e53ab9cd9812ca9de9ea8d899811bf63f"
    ],
    "inputTokensBpe": 10895,
    "evidencePosition": "middle"
  },
  {
    "questionId": "17a1eff7993c47c54eddc7344e7454fbe64191cd",
    "paperId": "1807.07279",
    "question": "What experiments do they use to quantify the extent of interpretability?",
    "inputSha256": "4c5598b1a94576140cb38f06c7402103e1789731c453f1f3980b2520e40cc432",
    "evidenceSetSha256": [
      "2654edcc0c24123bd4fd6c366562b0f74fbb76b06661a36510e35dc98acfe75d",
      "7746f223150cd9fe6c42c4438688054d0f8d015b66a8ad48b6887dfc08a3f907"
    ],
    "inputTokensBpe": 8838,
    "evidencePosition": "back"
  },
  {
    "questionId": "2c59528b6bc5b5dc28a7b69b33594b274908cca6",
    "paperId": "1905.11268",
    "question": "What is a semicharacter architecture?",
    "inputSha256": "fb679e94581ab313f92797ab73b658b5f7c5c72538627db9f495f2730c48e8a8",
    "evidenceSetSha256": [
      "ece1477bcf7c8e43566b1bd16295ccef0f75cdba395dfef82cd72095a4fb994a",
      "605a9d9c82c48539bcb92578a02b1ac32855547427cb6dc766545795a0d74ad4"
    ],
    "inputTokensBpe": 6285,
    "evidencePosition": "front"
  },
  {
    "questionId": "c81f215d457bdb913a5bade2b4283f19c4ee826c",
    "paperId": "1910.12574",
    "question": "Which publicly available datasets are used?",
    "inputSha256": "050e75a6e84c0366addfd4ef9dbf8967f93a5df377fb497d8083a3172560ef85",
    "evidenceSetSha256": [
      "e4a993b3df7bb55b5daa0e28eefa2c87865e12e18e6d7c8105210aa4b912b3d9",
      "1b4f13f782d17de6864c81c194b14484f53cbb36ad6771e1e1f300b07b641cda"
    ],
    "inputTokensBpe": 6367,
    "evidencePosition": "middle"
  },
  {
    "questionId": "ac7f6497be4bcca64e75f28934b207c9e8097576",
    "paperId": "1912.00903",
    "question": "What kind of sentences were read?",
    "inputSha256": "a5303d36db1be5c6b8d50afeef18965c9c8313c9e71319ed67ea31278b00b11f",
    "evidenceSetSha256": [
      "8c908a36aa75763b780f7c28dfa6913b3400dfeb98fe35094993f9239a751615",
      "8ace27a1a95e28d41b11b6390e43eb1c15ec3c292f46274084193e81decced0b"
    ],
    "inputTokensBpe": 4781,
    "evidencePosition": "front"
  },
  {
    "questionId": "adbf33c6144b2f5c40d0c6a328a92687a476f371",
    "paperId": "1802.07862",
    "question": "Does their NER model learn NER from both text and images?",
    "inputSha256": "887da54c1a839aa42bea35249fad9daa6110ab647733bbde69842ca642d13651",
    "evidenceSetSha256": [
      "7be68ad47609c532cea822576d0b10cac2a11f6f6bfe5c1f7450d83735e9778a"
    ],
    "inputTokensBpe": 5864,
    "evidencePosition": "front"
  },
  {
    "questionId": "184b0082e10ce191940c1d24785b631828a9f714",
    "paperId": "1604.00400",
    "question": "What is the common belief that this paper refutes? (c.f. 'contrary to the common belief, ROUGE is not much [sic] reliable'",
    "inputSha256": "7a3316f2e9811bad64d113fcb78e87cb6a30715eb6ee794318547a472a7cd705",
    "evidenceSetSha256": [
      "8241663db9eac5172292e918e84375bd2e2e2abb3f77112f26981ffbc619e472"
    ],
    "inputTokensBpe": 6877,
    "evidencePosition": "front"
  },
  {
    "questionId": "7705dd04acedaefee30d8b2c9978537afb2040dc",
    "paperId": "1604.00727",
    "question": "What word level and character level model baselines are used?",
    "inputSha256": "a2e2aee51ace7d32ecb0a27fa5a02dddf567f811e3cf88c5498783191198c1de",
    "evidenceSetSha256": [
      "6c29660e4e3c10f613a34f233fe092e20dabfa8d9e3489c334882521655e3782",
      "eb6333ee679f557f9cb094ce66dc60bebb4e0c7e6a181a3ba97bb15133a301b7"
    ],
    "inputTokensBpe": 5640,
    "evidencePosition": "middle"
  },
  {
    "questionId": "498c0229f831c82a5eb494cdb3547452112a66a0",
    "paperId": "1905.07791",
    "question": "How do they match annotators to instances?",
    "inputSha256": "cfe259fd7096eecaf2435319e964e5f71a1ce066506b79ded1499ce1ae2615e1",
    "evidenceSetSha256": [
      "13e96d71237867e8fac516d5e73a87b48c326c5fc1f288d819e852344542703f"
    ],
    "inputTokensBpe": 6065,
    "evidencePosition": "back"
  },
  {
    "questionId": "bd5bd1765362c2d972a762ca12675108754aa437",
    "paperId": "1804.05918",
    "question": "How much does this model improve state-of-the-art?",
    "inputSha256": "7caeb40c5982b15b47692c5ee64ba836c91ccde3a08003b22f05aab7276a6975",
    "evidenceSetSha256": [
      "56b0144b2bc53c70165964945c29a553c798169e97447f6f623d098a9788bb63",
      "cad7ed6e1fcc1ed603b1d91b8cf7f8d2b77861696f4900baa0ec17f25b3853d4"
    ],
    "inputTokensBpe": 5857,
    "evidencePosition": "back"
  },
  {
    "questionId": "747b847d687f703cc20a87877c5b138f26ff137d",
    "paperId": "1603.01514",
    "question": "Which parallel corpora are used?",
    "inputSha256": "dd99196e5938225b1e3edea8a0fec6f8a611cfbde38818195c8958c7618e5d48",
    "evidenceSetSha256": [
      "7fbf39fc122ec70204a14d5b84448468dd4018ba94a3f461a7b23fe533b39bd7"
    ],
    "inputTokensBpe": 5510,
    "evidencePosition": "middle"
  },
  {
    "questionId": "b0dbe75047310fec4d4ce787be5c32935fc4e37b",
    "paperId": "1809.03449",
    "question": "How do the authors examine whether a model is robust to noise or not?",
    "inputSha256": "a0a3ef20e627775a869ca47992ae4fc053f04ce78c82aeaa72cee0c17ec55f13",
    "evidenceSetSha256": [
      "56821916f83e229fa407dee1f7f7be9f5e83f8ceed38884edd0b640e7199d689",
      "03aac45e001944c6386408e2177e18214ad3d9379db34f0058fcfc5ca6d1c366"
    ],
    "inputTokensBpe": 5912,
    "evidencePosition": "back"
  },
  {
    "questionId": "787c4d4628eac00dbceb1c96020bff0090edca46",
    "paperId": "2003.08385",
    "question": "What annotations are present in dataset?",
    "inputSha256": "0270d24089dd0c9106233485aa90d632dd1054f6bed6212f485723b411af7cc4",
    "evidenceSetSha256": [
      "884ceda0d0b0b3490c36e45226d6c90fe8608835627860a2175822af0c3feaad"
    ],
    "inputTokensBpe": 5671,
    "evidencePosition": "front"
  },
  {
    "questionId": "c70bafc35e27be9d1efae60596bc0dd390c124c0",
    "paperId": "1911.00841",
    "question": "Are the answers double (and not triple) annotated?",
    "inputSha256": "b95283cdaa5ac96aebfc6dacc19de3deacc4b3025fb29003fe41f37302415f04",
    "evidenceSetSha256": [
      "11454936601e7bc0cebdd4305003290f2576d5acd30433261234f48d10e657c8"
    ],
    "inputTokensBpe": 5639,
    "evidencePosition": "front"
  },
  {
    "questionId": "e807d347742b2799bc347c0eff19b4c270449fee",
    "paperId": "2002.01984",
    "question": "What dataset did they use?",
    "inputSha256": "858820e1acfbdbb76a74d9f8b8d9ba48e7e1144a04342a6ad0d9a2f2b2925f81",
    "evidenceSetSha256": [
      "e1895a791146850d12b1ad30febeb1ab6bcaea0d920eb77e59dbb8d394f3f990"
    ],
    "inputTokensBpe": 11607,
    "evidencePosition": "front"
  },
  {
    "questionId": "b6f7fadaa1bb828530c2d6780289f12740229d84",
    "paperId": "1903.11437",
    "question": "what language pairs are explored?",
    "inputSha256": "b010ac2e4e190957ce5829cc738c136e04ae9b6a03df3685c24a2e93ad726678",
    "evidenceSetSha256": [
      "77b8e12f12e2b3b897cfddf5c584aed615345487dd6a2a0d4222fffa2bb29730"
    ],
    "inputTokensBpe": 5903,
    "evidencePosition": "front"
  },
  {
    "questionId": "3941401a182a3d6234894a5c8a75d48c6116c45c",
    "paperId": "1912.00667",
    "question": "Which real-world datasets are used?",
    "inputSha256": "8878b9ca3f107ff51659920b66ed895d4c5b623f8769c8c458cfff10c9caa156",
    "evidenceSetSha256": [
      "477157023969774c40b80bf23fad95aa9aa4866ae739806c96a0350739129765",
      "5313b6689bdd9ab06780eca1635b0b5e4ffb12ef45a01ca30ff4b65a28eb2646"
    ],
    "inputTokensBpe": 7173,
    "evidencePosition": "middle"
  },
  {
    "questionId": "b3de9357c569fb1454be8f2ac5fcecaea295b967",
    "paperId": "2004.02192",
    "question": "How many tweets are in the dataset?",
    "inputSha256": "b238f3d097bf416db536ff03f4faf9a85101d4710d1e633e860dea9caad93830",
    "evidenceSetSha256": [
      "8e4cd0f8ea6bbe6e7b3cfa41b8b18dda863fb0fd5fbcc49abdb2fcfc4c1d900f"
    ],
    "inputTokensBpe": 7557,
    "evidencePosition": "front"
  },
  {
    "questionId": "e0e379e546f1da9da874a2e90c79b41c60feb817",
    "paperId": "1908.01294",
    "question": "How do they utilize unlabeled data to improve model representations?",
    "inputSha256": "ec8bdc85dfaceaa794eec72d2af5cfb4bfda74f69260b429e6ffb653985bf45b",
    "evidenceSetSha256": [
      "56b0950bcec6944546dbbdab66c165b590d986d32c4e22ee1bbfc6033b8ceb08"
    ],
    "inputTokensBpe": 9705,
    "evidencePosition": "front"
  },
  {
    "questionId": "30af1926559079f59b0df055da76a3a34df8336f",
    "paperId": "1912.03627",
    "question": "what is the source of the data?",
    "inputSha256": "641f75bfa4d4bebb831a1cbbb2b6151e716bdbfdb678cde8f80ac540e3e68777",
    "evidenceSetSha256": [
      "03c170fed8392e3315e8af4bab5a57d8d0b1f53a6475f9ef93d7f82cada48e05"
    ],
    "inputTokensBpe": 5480,
    "evidencePosition": "front"
  },
  {
    "questionId": "63a1cbe66fd58ff0ead895a8bac1198c38c008aa",
    "paperId": "1912.08960",
    "question": "Which existing models are evaluated?",
    "inputSha256": "9bd63095b3d72561ffc3030ea2e79ad7f8b169c93dc1342201be26ab99729f64",
    "evidenceSetSha256": [
      "dcd1655b8b9668658e6b22321479b3c9e7350eb10953f243702d0f39c2c22419",
      "bcc17d39024539ad5179083d03f2c9206401bb98fa48d097a2d378eccc522a82"
    ],
    "inputTokensBpe": 4766,
    "evidencePosition": "middle"
  },
  {
    "questionId": "6a633811019e9323dc8549ad540550d27aa6d972",
    "paperId": "1603.01987",
    "question": "Is it valid to presume a bad medical wikipedia article should not contain much domain-specific jargon?",
    "inputSha256": "432138af5316f4918ecdc8791bb4bb1b4f90b86c53cd67882b881e9bee3a7c4f",
    "evidenceSetSha256": [
      "96d41005168e348330bc0e884229fc62b6eea19511adaced70d16c8c7e9dc5cf"
    ],
    "inputTokensBpe": 6681,
    "evidencePosition": "middle"
  },
  {
    "questionId": "2da4c3679111dd92a1d0869dae353ebe5989dfd2",
    "paperId": "1908.08717",
    "question": "What are four major corpora of French broadcast?",
    "inputSha256": "09b3e11529d737592db9428805d4b7cd45491fc272e28d06cbb8ae667ef4bfbc",
    "evidenceSetSha256": [
      "eeab3e8810d7735518dda88b9754175c777886d1b650e8f328e552d58968b1e4"
    ],
    "inputTokensBpe": 5574,
    "evidencePosition": "front"
  },
  {
    "questionId": "20e38438471266ce021817c6364f6a46d01564f2",
    "paperId": "1911.02855",
    "question": "How are weights dynamically adjusted?",
    "inputSha256": "25f3d29d2f75218f2ef3cb4d6f0cd557516816f9a35a02010a8fd9dccf0f5ae4",
    "evidenceSetSha256": [
      "abcb182bac025396021426534702affed0ef87586e87664ecb99cc1f92b08d94"
    ],
    "inputTokensBpe": 6226,
    "evidencePosition": "front"
  },
  {
    "questionId": "0ee73909ac638903da4a0e5565c8571fc794ab96",
    "paperId": "1612.02482",
    "question": "How were the human judgements assembled?",
    "inputSha256": "a266d15f8536c69548138b2b953b3101171cf3d2a36b510a6838892840edc089",
    "evidenceSetSha256": [
      "c6fb767d0cd409a65c04e7c2b2861e27222029e1bac3d45f9c9c4ca1bccb5553",
      "a155cef5c45bc1247f844bff686f022ee354a8e1dd49689a50ae13296596abc0"
    ],
    "inputTokensBpe": 7258,
    "evidencePosition": "middle"
  },
  {
    "questionId": "dd09db5eb321083dba16c2550676e60682f9a0cd",
    "paperId": "1908.06264",
    "question": "What labels does the dataset have?",
    "inputSha256": "1fde9798ea5dc65477ab0c3e3c7b60e60289d39b9e0c88aeb06c9ff076a5d0af",
    "evidenceSetSha256": [
      "f937908113e9e6dd6ad56e8c46c15aa1d80dfee87be34ad02d5ea52b605ad193"
    ],
    "inputTokensBpe": 4715,
    "evidencePosition": "front"
  },
  {
    "questionId": "b46c0015a122ee5fb95c2a45691cb97f80de1bb6",
    "paperId": "1809.00530",
    "question": "What is the architecture of the model?",
    "inputSha256": "a579c4defd04c11fc53ab5ace3e139a9a4e2e5a7238f3c57f5087d3ab2af0484",
    "evidenceSetSha256": [
      "761eac72cb35b415f0b1d9fda72484e37614104fac800e5a47510eeccb997ec0",
      "e6690d5b92734a437d90dd02e6124c21a441d6cc1a5a0da2d8d4c454d1dddfad"
    ],
    "inputTokensBpe": 7050,
    "evidencePosition": "front"
  },
  {
    "questionId": "c35806cf68220b2b9bb082b62f493393b9bdff86",
    "paperId": "1809.02279",
    "question": "What were their best results on the benchmark datasets?",
    "inputSha256": "33823f7092d0bbf33d2b84d15b9aa2d20852dadcd4be8a0c9a019b46f3acb470",
    "evidenceSetSha256": [
      "97d9ee057911926099c0c8156adc8c830421472fb7bbd1ec05b2d2f945bb057c",
      "8c7f5ffae5d6bc1a8d33f1cde9a72b5540f29a21d7ff7a18a64475dd30e6a3fb"
    ],
    "inputTokensBpe": 4782,
    "evidencePosition": "middle"
  },
  {
    "questionId": "113d791df6fcfc9cecfb7b1bebaf32cc2e4402ab",
    "paperId": "1708.01464",
    "question": "how is model compactness measured?",
    "inputSha256": "28d60ede5180bd461f3d9218d71a65566ea335cb51e8973788c7c7bd29b650f2",
    "evidenceSetSha256": [
      "1cd66dcb9a4c9ca557dc6f1f6b0b1b7000becf9d505bcb5f68caff6959495b9b"
    ],
    "inputTokensBpe": 4538,
    "evidencePosition": "back"
  },
  {
    "questionId": "2275b0e195cd9cb25f50c5c570da97a4cce5dca8",
    "paperId": "2002.07306",
    "question": "How is the model transferred to other languages?",
    "inputSha256": "631e3fe10c0ee4bf687be8a4ccdbac0c5b4e8a517a9a571ea6c08363508f56ad",
    "evidenceSetSha256": [
      "73578d6b7285c9cf80b2c96580cf3e14a39517cf247880431bb6a7ed9f41d311"
    ],
    "inputTokensBpe": 5632,
    "evidencePosition": "front"
  },
  {
    "questionId": "bdc91d1283a82226aeeb7a2f79dbbc57d3e84a1a",
    "paperId": "1909.03405",
    "question": "How much is performance improved on NLI?",
    "inputSha256": "5d4c4675ccb497cf0b8fc1a739625c436cf893f2702f697b08d0cad853d4df22",
    "evidenceSetSha256": [
      "5c83cded5ba465d5aeeafe745614dd6e61cd6cb5ae2bab84777deaa64bfda116"
    ],
    "inputTokensBpe": 6193,
    "evidencePosition": "middle"
  },
  {
    "questionId": "565189b672efee01d22f4fc6b73cd5287b2ee72c",
    "paperId": "1903.11437",
    "question": "what dataset is used?",
    "inputSha256": "b010ac2e4e190957ce5829cc738c136e04ae9b6a03df3685c24a2e93ad726678",
    "evidenceSetSha256": [
      "1d6831b04eabafc4f4614b5e880b3c3a4c9e9cc2c52425848ac661808cb8f7e9",
      "98e6a298d98ac5850dfeb708c6cf162c8276dfd9173086eb29d7123f0dc1b84a"
    ],
    "inputTokensBpe": 5903,
    "evidencePosition": "front"
  },
  {
    "questionId": "2c85865a65acd429508f50b5e4db9674813d67f2",
    "paperId": "1903.03530",
    "question": "Which data do they use as a starting point for the dialogue dataset?",
    "inputSha256": "4afcf190e58ed3be6812e89e0d4b373b6baeebaf9ec63aabfb60c39c3cdf4f33",
    "evidenceSetSha256": [
      "394a8a7098a4d3f04a75c068c687291fa3b351ee966a63827ff6f498b64797f5",
      "6899cb30c9b9738bc38f2f9658eb1ec72af66087bf789d2be092377e4e820f91"
    ],
    "inputTokensBpe": 4887,
    "evidencePosition": "middle"
  },
  {
    "questionId": "2fbb6322e485e7743ec3fb4bb02d44bf4b5ea8a6",
    "paperId": "1701.02962",
    "question": "What dataset do they use to evaluate their method?",
    "inputSha256": "f576021de8bc6e61785d0810a645980a8b5a9cfde57909b96ee4ce123c692e9f",
    "evidenceSetSha256": [
      "8eee7a6ad553f2cb8f189c44cca12340feddcf9e31ac3ecd630c0b8c6d9a1ba5",
      "fa5f95fc254dc22a8fe15d9d475ee6ffc940b01995def51b77d2c4f8920295b6"
    ],
    "inputTokensBpe": 5641,
    "evidencePosition": "back"
  },
  {
    "questionId": "545e92833b0ad4ba32eac5997edecf97a366a244",
    "paperId": "1908.06267",
    "question": "Which component has the greatest impact on performance?",
    "inputSha256": "267373eeb22199cbfa6521e35fe48b7aa8863aa859195d68c51579c550798e2f",
    "evidenceSetSha256": [
      "7a2818e8030e576c319475b9fe3b22a522d3b4abd4ff9d1d7f58eb6f38f90e40"
    ],
    "inputTokensBpe": 6832,
    "evidencePosition": "back"
  },
  {
    "questionId": "1462eb312944926469e7cee067dfc7f1267a2a8c",
    "paperId": "1908.05828",
    "question": "How many different types of entities exist in the dataset?",
    "inputSha256": "d569d8bcf7c7badb620063bf4095134edb3f15a158b28ba83c0de5ee917a4ae2",
    "evidenceSetSha256": [
      "d6ae593fc6f7bd2c3ba697b88612e9210d654c71dd6e3a1bcb071d3323d3c3da",
      "fa47bb851bcdad36fa7d8c67fa264f9288acb43ceb9c314df6561ecd3127d78a"
    ],
    "inputTokensBpe": 4469,
    "evidencePosition": "middle"
  },
  {
    "questionId": "0d34c0812f1e69ea33f76ca8c24c23b0415ebc8d",
    "paperId": "2001.01269",
    "question": "Which hand-crafted features are combined with word2vec?",
    "inputSha256": "3037c0af0874a247465e1f976d109ed9a4726b5d47ef9f93d38a0885e60d6426",
    "evidenceSetSha256": [
      "215783623336f7b1cdba543d6934ac75f9eae5a49feb7066629ee3c0505671ad"
    ],
    "inputTokensBpe": 5327,
    "evidencePosition": "middle"
  },
  {
    "questionId": "af5730d82535464cedfa707a03415ac2e7a21295",
    "paperId": "1910.14599",
    "question": "What data sources do they use for creating their dataset?",
    "inputSha256": "00c7af5b5bf96a870d104372efa4c7f76b2c8d5c719ec020c738347a27e6835e",
    "evidenceSetSha256": [
      "c2b8d8b13b12b78f35f0b7daf7981aa090bcb3c54edcb556977273a1fb5f0d58",
      "9a256a2b58cb6ecb9787e79f915b5c6c80bd9aebdc1f08eac932c89e3afee0c0"
    ],
    "inputTokensBpe": 6828,
    "evidencePosition": "front"
  },
  {
    "questionId": "7697baf8d8d582c1f664a614f6332121061f87db",
    "paperId": "1601.02403",
    "question": "Which machine learning methods are used in experiments?",
    "inputSha256": "ef4d9e5adbd5b1ae77d0b817fea6749491095517674c5225f7129fe6bb1f66cb",
    "evidenceSetSha256": [
      "3dd6df2d7b98da22da820c86093ecaeae1e0d22234b96d1dbcc25b1130fa049c"
    ],
    "inputTokensBpe": 21004,
    "evidencePosition": "back"
  },
  {
    "questionId": "0689904db9b00a814e3109fb1698086370a28fa2",
    "paperId": "1811.05711",
    "question": "Which text embedding methodologies are used?",
    "inputSha256": "91fa84133325d0c7e2b4e6ff7d7a4a3677d2ece689800d9a711f7ac3421accb2",
    "evidenceSetSha256": [
      "57a1cffc66bdbd07f8b77ad17a0154939bcacead96aca6886512bbb6c334ca98",
      "c29da5af4765e21279f4e0a9b8e43cdeca7dc24addd2bec1c9db362d93604ba1"
    ],
    "inputTokensBpe": 12017,
    "evidencePosition": "front"
  },
  {
    "questionId": "5eabfc6cc8aa8a99e6e42514ef9584569cb75dec",
    "paperId": "1808.09111",
    "question": "Do they evaluate only on English datasets?",
    "inputSha256": "139dde336e44123bbf9013a93127d281a9eb915980eeb5ae5df528f8b9075c2c",
    "evidenceSetSha256": [
      "fdbd30feb6e98e9e662761e7cc40923e14aea11eb0ef7bb0932a93b67fe486e6"
    ],
    "inputTokensBpe": 6241,
    "evidencePosition": "middle"
  },
  {
    "questionId": "5c3e98e3cebaecd5d3e75ec2c9fc3dd267ac3c83",
    "paperId": "1909.06200",
    "question": "What experiments are conducted?",
    "inputSha256": "112fe96b53d1341c2de57775fc849f83ee4078e3d35456e1cc10f22fb336fb43",
    "evidenceSetSha256": [
      "2c61d44411af3daf54e9ac6714dbd761a31f773290a5d469bc8668d49ba7b5ea"
    ],
    "inputTokensBpe": 6324,
    "evidencePosition": "middle"
  },
  {
    "questionId": "73e83c54251f6a07744413ac8b8bed6480b2294f",
    "paperId": "2001.01269",
    "question": "What word-based and dictionary-based feature are used?",
    "inputSha256": "3037c0af0874a247465e1f976d109ed9a4726b5d47ef9f93d38a0885e60d6426",
    "evidenceSetSha256": [
      "b893d4c763f9b5d0f1799e3d32bd4a741a6b686360069c03c33e6d66122863ba"
    ],
    "inputTokensBpe": 5327,
    "evidencePosition": "front"
  },
  {
    "questionId": "d7b60abb0091246e29d1a9c28467de598e090c20",
    "paperId": "1706.01875",
    "question": "What was the baseline?",
    "inputSha256": "9d462898c833d06a008b059d07d6cfe950a0f48d02b3a993701a44f858ecca53",
    "evidenceSetSha256": [
      "cdb6bc0ad645e350840a2cc1a66a4c1c75d853321a19767b95bfb9f7bda3475d"
    ],
    "inputTokensBpe": 4580,
    "evidencePosition": "middle"
  },
  {
    "questionId": "3d013f15796ae7fed5272183a166c45f16e24e39",
    "paperId": "1909.09067",
    "question": "Which information about typography is included in the corpus?",
    "inputSha256": "840737d1752663622c60bae3dd9ac0ffff5e990f34ef7c862a8ae6ddb1331a72",
    "evidenceSetSha256": [
      "5a29bed1cf2a2de5f8611202624dd67fd6e9c2a4a10c89653a356eecb8b17424",
      "ad047923a07648dce90b5e373e0923f3cd5122f0d9d2b53f803ffb80329665df"
    ],
    "inputTokensBpe": 4193,
    "evidencePosition": "front"
  },
  {
    "questionId": "2c947447d81252397839d58c75ebcc71b34379b5",
    "paperId": "2001.08868",
    "question": "On what Text-Based Games are experiments performed?",
    "inputSha256": "4898a51527fe5408c3c440939047eecec02ef50b84d9716ca9130a2b32ca7cac",
    "evidenceSetSha256": [
      "0eab52115b366033bcd42a73225ba310886fe22242b441942392b39db993ad7e",
      "046a44b7d98c9402d9ceff2c723df5a5a18e0ae59d4b9e099b52f1d0d64a5454"
    ],
    "inputTokensBpe": 7614,
    "evidencePosition": "middle"
  },
  {
    "questionId": "87bb3105e03ed6ac5abfde0a7ca9b8de8985663c",
    "paperId": "1903.11437",
    "question": "why are their techniques cheaper to implement?",
    "inputSha256": "b010ac2e4e190957ce5829cc738c136e04ae9b6a03df3685c24a2e93ad726678",
    "evidenceSetSha256": [
      "fc03e0be495b8e90838df26b550c764dfbafc7ee11f2f19b1c436ff3aa953048",
      "3b081f9dad6bc9b3f47901354d1b911e7bb1e87345828fc6ac5005bede575ce2"
    ],
    "inputTokensBpe": 5903,
    "evidencePosition": "middle"
  },
  {
    "questionId": "051df74dc643498e95d16e58851701628fdfd43e",
    "paperId": "1911.01371",
    "question": "How did they obtain the OSG dataset?",
    "inputSha256": "a1a179db033b6fe6023cf8472447ea6a558312b659a57b3ca55276357b9e959a",
    "evidenceSetSha256": [
      "ef69a736dbe51f1246cff3d0ca58576d23e4b2b632ef7d7f5f0517adcf99ec51"
    ],
    "inputTokensBpe": 5095,
    "evidencePosition": "middle"
  },
  {
    "questionId": "c21b87c97d1afac85ece2450ee76d01c946de668",
    "paperId": "2002.03407",
    "question": "What is the recent abstractive summarization method in this paper?",
    "inputSha256": "e6e1951a4c2d088b552232b5da5920f72a9d9566e982fd2b4091364650b36b93",
    "evidenceSetSha256": [
      "5b4890e375ddb980bd8824b14022c64a20072dc4607e0234118676febaed2e9c",
      "eb0a20318f5d7e8d98cccdc316ed32310e1973a8aad9418cca987b1fffdba0a8"
    ],
    "inputTokensBpe": 5323,
    "evidencePosition": "front"
  },
  {
    "questionId": "1e775cf30784e6b1c2b573294a82e145a3f959bb",
    "paperId": "1909.13104",
    "question": "What language(s) is/are represented in the dataset?",
    "inputSha256": "773e6d3347d23380eb0d87b5d725a5f8b4dac319e31d78084991f9b5909d69a3",
    "evidenceSetSha256": [
      "c99aa69dbdcc7ee4c32a8a555eb9ec5970d5e3289eb213132894fe1c9167a674",
      "84a169104cc966c87a31f8df7cd0a1247ec3b54aa3fc8e30b7c63da72abc91d1"
    ],
    "inputTokensBpe": 4417,
    "evidencePosition": "middle"
  },
  {
    "questionId": "0752d71a0a1f73b3482a888313622ce9e9870d6e",
    "paperId": "1708.01464",
    "question": "what was the baseline?",
    "inputSha256": "28d60ede5180bd461f3d9218d71a65566ea335cb51e8973788c7c7bd29b650f2",
    "evidenceSetSha256": [
      "15845799a3d7f79f6ae44b89a367c192d08b194bdf080af47d4421715a53225a"
    ],
    "inputTokensBpe": 4538,
    "evidencePosition": "middle"
  },
  {
    "questionId": "ceb767e33fde4b927e730f893db5ece947ffb0d8",
    "paperId": "1810.12085",
    "question": "what topics did they label?",
    "inputSha256": "3bfbf2e1bb6568c9cc6edfd9cbab028690a838d22a9112fcd2b3d6d448538b9c",
    "evidenceSetSha256": [
      "5ca26b032c9e130556e3289be4acb89a0782f7098573a4a0c2c9e2458a6e9d6c"
    ],
    "inputTokensBpe": 4161,
    "evidencePosition": "middle"
  },
  {
    "questionId": "d64383e39357bd4177b49c02eb48e12ba7ffd4fb",
    "paperId": "1809.03449",
    "question": "What type of model is KAR?",
    "inputSha256": "a0a3ef20e627775a869ca47992ae4fc053f04ce78c82aeaa72cee0c17ec55f13",
    "evidenceSetSha256": [
      "0a3851b1ba8f07e94ce90c61b14bdedab7410d8ebcfa5c433aadde77fc0f2366"
    ],
    "inputTokensBpe": 5912,
    "evidencePosition": "middle"
  },
  {
    "questionId": "e97186c51d4af490dba6faaf833d269c8256426c",
    "paperId": "1912.13337",
    "question": "Are the automatically constructed datasets subject to quality control?",
    "inputSha256": "07f35485c40bfe444e2a1f8b58b097b45aae458368a72c20e7ea2debda8204f9",
    "evidenceSetSha256": [
      "57798dd7bbcb9dba61b4b785cb5fbb78938c5dffce5a7225c1a3d58739ad83be"
    ],
    "inputTokensBpe": 9961,
    "evidencePosition": "back"
  },
  {
    "questionId": "12f7fac818f0006cf33269c9eafd41bbb8979a48",
    "paperId": "1901.01010",
    "question": "What kind of model do they use?",
    "inputSha256": "9c05d4692b345f5527c8d1fbcc72f215b6bebaa9ff89fc4282110e4bc4c2f26f",
    "evidenceSetSha256": [
      "572bb6ec3752b923aa1568b8ff714038ddf62bb9813bda91a9cdc9f01073239d",
      "0891bccea5908a99dd3de825d6365ac6f438234505c6961f8bf3cfb651747dc6"
    ],
    "inputTokensBpe": 5893,
    "evidencePosition": "front"
  },
  {
    "questionId": "da55bd769721b878dd17f07f124a37a0a165db02",
    "paperId": "2001.02284",
    "question": "What kind of repetitive and time-consuming activities does their assistant handle?",
    "inputSha256": "a66c9215ca842646f6a4a74059e9b145178b5bd76b6d1d8f48c24cb814868aa2",
    "evidenceSetSha256": [
      "1f7ed529fe510f03866cc8163579b46b26f561f4b0dfcef0f869acb0928ba506"
    ],
    "inputTokensBpe": 9066,
    "evidencePosition": "front"
  },
  {
    "questionId": "96a4091f681872e6d98d0efee777d9e820cb8dae",
    "paperId": "1910.12574",
    "question": "What biases does their model capture?",
    "inputSha256": "050e75a6e84c0366addfd4ef9dbf8967f93a5df377fb497d8083a3172560ef85",
    "evidenceSetSha256": [
      "5bde0b7e308fcf777d82a856ed403669494bcd6de400f66580559aabc28dda89"
    ],
    "inputTokensBpe": 6367,
    "evidencePosition": "back"
  },
  {
    "questionId": "df0257ab04686ddf1c6c4d9b0529a7632330b98e",
    "paperId": "2001.08868",
    "question": "How better does new approach behave than existing solutions?",
    "inputSha256": "4898a51527fe5408c3c440939047eecec02ef50b84d9716ca9130a2b32ca7cac",
    "evidenceSetSha256": [
      "123346219cba70b611bb6b4e0da5c8d98ab3d38a8be3bd75333136a72dd65bc3",
      "a2f59c29d104f64882aa99309b320b282abbe87dee160096d136cf3de5798cca"
    ],
    "inputTokensBpe": 7614,
    "evidencePosition": "back"
  },
  {
    "questionId": "bf52c01bf82612d0c7bbf2e6a5bb2570c322936f",
    "paperId": "1604.00400",
    "question": "What different correlations result when using different variants of ROUGE scores?",
    "inputSha256": "7a3316f2e9811bad64d113fcb78e87cb6a30715eb6ee794318547a472a7cd705",
    "evidenceSetSha256": [
      "59c95ff3c565592cddbca32238d97fd3a6e13e505c712992942039a417068ada",
      "707fd7338269f1b3ab213d96f9bf4c5cd9c3a3934759fe0a72b804c2e682183f"
    ],
    "inputTokensBpe": 6877,
    "evidencePosition": "back"
  },
  {
    "questionId": "76121e359dfe3f16c2a352bd35f28005f2a40da3",
    "paperId": "1503.00841",
    "question": "What NLP tasks do they consider?",
    "inputSha256": "9952421dde110843b43e5fc9f8a46ce5556d3377f52bf423f5770432564ecd8f",
    "evidenceSetSha256": [
      "260f87fbc7e81fd673546917a7a3358b337bfd2502611be1e9bbfa04d4281d57"
    ],
    "inputTokensBpe": 5378,
    "evidencePosition": "middle"
  },
  {
    "questionId": "8b3d3953454c88bde88181897a7a2c0c8dd87e23",
    "paperId": "1609.00559",
    "question": "What embedding techniques are explored in the paper?",
    "inputSha256": "5bbbfef6db7b11aaa468212345394e18113b58977265dd7ad0e40b27da239749",
    "evidenceSetSha256": [
      "69a8f6e9ae55145c1fbd3031be2475a1945fe8bc966110fb7c686b2efb548eb0",
      "76ce785cc29212bec906d035526162c7a4d420a9caa2965168e6893f05cf3d30"
    ],
    "inputTokensBpe": 5979,
    "evidencePosition": "back"
  },
  {
    "questionId": "cf171fad0bea5ab985c53d11e48e7883c23cdc44",
    "paperId": "2001.01269",
    "question": "What details are given about the Twitter dataset?",
    "inputSha256": "3037c0af0874a247465e1f976d109ed9a4726b5d47ef9f93d38a0885e60d6426",
    "evidenceSetSha256": [
      "398c61569a2ccb46be578e8c35812a6421ba131d3fe4f585b573bcda9e767c5b"
    ],
    "inputTokensBpe": 5327,
    "evidencePosition": "middle"
  },
  {
    "questionId": "392fb87564c4f45d0d8d491a9bb217c4fce87f03",
    "paperId": "1909.13104",
    "question": "What baseline model is used?",
    "inputSha256": "773e6d3347d23380eb0d87b5d725a5f8b4dac319e31d78084991f9b5909d69a3",
    "evidenceSetSha256": [
      "c094cb17d384e50031686610df66a6f5eda4602e8b1db8574b6ee1217dc0a36b",
      "f4e54ee98cfccf046196589e82fc081609c0cec59ca429d13d0b9bde54764789"
    ],
    "inputTokensBpe": 4417,
    "evidencePosition": "back"
  },
  {
    "questionId": "2cd37743bcc7ea3bd405ce6d91e79e5339d7642e",
    "paperId": "1601.02403",
    "question": "Do they report results only on English data?",
    "inputSha256": "ef4d9e5adbd5b1ae77d0b817fea6749491095517674c5225f7129fe6bb1f66cb",
    "evidenceSetSha256": [
      "36320cd179cea525a94585e6e77a91242c605355fd2dd0cc9648b2240b175d4b"
    ],
    "inputTokensBpe": 21004,
    "evidencePosition": "front"
  },
  {
    "questionId": "41ac23e32bf208b69414f4b687c4f324c6132464",
    "paperId": "1611.04798",
    "question": "Which languages do they test on for the under-resourced scenario?",
    "inputSha256": "3834c6efbc8c877029b4b18056f86a46e63f11b12aa5e72e43de9c09a2bc24c8",
    "evidenceSetSha256": [
      "3c8757bce95f92bd2116132cae82f2b4020776d1527e721aad350edd1f569da6",
      "310643d7e9e1270836d4f8457380f8af3208ef69c22facfa362583eb3a68ea38"
    ],
    "inputTokensBpe": 5969,
    "evidencePosition": "back"
  },
  {
    "questionId": "06cc8fcafc0880cf69a2514bb7341642b9833041",
    "paperId": "1809.06537",
    "question": "what is the size of the real-world civil case dataset?",
    "inputSha256": "4931b2888885da84f1245f11449b19cb6cb8ec2f2882df4e1a3ad44d4a534b0b",
    "evidenceSetSha256": [
      "bc70e34b5e71ac36956fdd30b33d21a80ee647ea110da7a87d33ab0dd0609f86",
      "0a0475528bd338803fcb6c54e8380caa6aada37bc1b811a78d58ede99e9563b9"
    ],
    "inputTokensBpe": 5906,
    "evidencePosition": "front"
  },
  {
    "questionId": "b66c9a4021b6c8529cac1a2b54dacd8ec79afa5f",
    "paperId": "1909.08089",
    "question": "What do they mean by global and local context?",
    "inputSha256": "5eb59efffcf99b2d9e76c87faa3b7d5c200c2bac0f3c0069c1b4550b92807bc9",
    "evidenceSetSha256": [
      "31a7d500c4c5251ef5aa55b29c185ed0d739d4439c197f24eb4738893fe2ba08"
    ],
    "inputTokensBpe": 6036,
    "evidencePosition": "front"
  },
  {
    "questionId": "b49598b05358117ab1471b8ebd0b042d2f04b2a4",
    "paperId": "1611.08661",
    "question": "What neural models are used to encode the text?",
    "inputSha256": "48ef9997cf16fc6ac03f9e9e61e6865e98eb486f2807b444181fefef9678f9ef",
    "evidenceSetSha256": [
      "e82a7199a95e30306103bb0adce76d7c415904f6500c9eca6b61864f7532b51c",
      "f83ec2d31db59e7f820ad43636ae172ec489742524f019591c708a552704f489"
    ],
    "inputTokensBpe": 5593,
    "evidencePosition": "front"
  },
  {
    "questionId": "6cd25c637c6b772ce29e8ee81571e8694549c5ab",
    "paperId": "1804.07789",
    "question": "What dataset is used?",
    "inputSha256": "b8c444c92eb1f6b2e1ea34e33d46ce81d7df82fa1a8faea2b454284eb2ebf0be",
    "evidenceSetSha256": [
      "4b53f53f5e7493cf462bacfa6a7477a36e2efaf8cfb1f3264d2d582a2a2ad12b"
    ],
    "inputTokensBpe": 6287,
    "evidencePosition": "middle"
  },
  {
    "questionId": "4944cd597b836b62616a4e37c045ce48de8c82ca",
    "paperId": "1908.10084",
    "question": "What transfer learning tasks are evaluated?",
    "inputSha256": "93d97c33a329d46219104cbc7f30d5f72b727ecc9e65daa009428b236c2a5c54",
    "evidenceSetSha256": [
      "61307547d5904e432479578387c4b9ae97c4278f412338d7392fdf085e4f6651"
    ],
    "inputTokensBpe": 6061,
    "evidencePosition": "front"
  },
  {
    "questionId": "d201b9992809142fe59ae74508bc576f8ca538ff",
    "paperId": "1906.00346",
    "question": "IS the graph representation supervised?",
    "inputSha256": "cb878986bf38fa697f5acc30c896bf4bf2322882ca1cbfc8e3398c361cf3760b",
    "evidenceSetSha256": [
      "d926015d4dcfa32391bc9277c0f75133c8c5263916535fea16a109e414fdcf4c"
    ],
    "inputTokensBpe": 6405,
    "evidencePosition": "middle"
  },
  {
    "questionId": "2a564b092916f2fabbfe893cf13de169945ef2e1",
    "paperId": "2001.01269",
    "question": "What details are given about the movie domain dataset?",
    "inputSha256": "3037c0af0874a247465e1f976d109ed9a4726b5d47ef9f93d38a0885e60d6426",
    "evidenceSetSha256": [
      "dde12630fb24496de3fdc06479db2324e022e9f5cfa209faffeeddc965eb9947",
      "b4af7b86c4e14e322a1c91a116e1a73e3eec8fe7c5e5c50ee3b1dd4b49b36fa8"
    ],
    "inputTokensBpe": 5327,
    "evidencePosition": "middle"
  },
  {
    "questionId": "443d2448136364235389039cbead07e80922ec5c",
    "paperId": "1712.00991",
    "question": "What summarization algorithms did the authors experiment with?",
    "inputSha256": "766b3260b82e18a919b5bab5e2e75c250c3893701cf95dfbac6f36834165b070",
    "evidenceSetSha256": [
      "0cdf76cc4679bcad1901aac9ff7edff49c35e712b67f28b8c2d8ba66622dfb1e",
      "b3188e6b851d2f71ae015a00cc4107139a98f77e38e0d486ea50b2b6a6fecd8f"
    ],
    "inputTokensBpe": 4556,
    "evidencePosition": "back"
  },
  {
    "questionId": "8a7615fc6ff1de287d36ab21bf2c6a3b2914f73d",
    "paperId": "1908.05828",
    "question": "Which machine learning models do they explore?",
    "inputSha256": "d569d8bcf7c7badb620063bf4095134edb3f15a158b28ba83c0de5ee917a4ae2",
    "evidenceSetSha256": [
      "a7189cdab12347ba0b0cccaa6b83fea097fe5d5111fcc2af6e988fe91e4e3cd6",
      "1633d47a6aab898ea2f6d2fd2990362668e5c562bdac7e3c7a9b009bc80c9313"
    ],
    "inputTokensBpe": 4469,
    "evidencePosition": "front"
  },
  {
    "questionId": "5913930ce597513299e4b630df5e5153f3618038",
    "paperId": "1909.00015",
    "question": "How does their model improve interpretability compared to softmax transformers?",
    "inputSha256": "e2116968306a3c4d54a635c3fca6df24d69760cb7cecd50c9655c3bda1f9c7cf",
    "evidenceSetSha256": [
      "8a6447de0d69f88fad7bd4ab7ed006804c850199cde20a1b6f6f0ea74661cd80",
      "d11fff5c3a99115dc534491f0eb2256657433e792b46eee15a78265ccc909f62"
    ],
    "inputTokensBpe": 10009,
    "evidencePosition": "front"
  },
  {
    "questionId": "31735ec3d83c40b79d11df5c34154849aeb3fb47",
    "paperId": "2002.03407",
    "question": "Who were the human evaluators used?",
    "inputSha256": "e6e1951a4c2d088b552232b5da5920f72a9d9566e982fd2b4091364650b36b93",
    "evidenceSetSha256": [
      "1b7aee43229acaef0dfaec19f4a055953e09f12cbec7975c14cd2cedb83063bd",
      "259fd09fa642a51a23f969d213451246af62558ce81f2733d6ceca9cb46c6012"
    ],
    "inputTokensBpe": 5323,
    "evidencePosition": "back"
  },
  {
    "questionId": "897ba53ef44f658c128125edd26abf605060fb13",
    "paperId": "1611.04798",
    "question": "Do they test their framework performance on commonly used language pairs, such as English-to-German?",
    "inputSha256": "3834c6efbc8c877029b4b18056f86a46e63f11b12aa5e72e43de9c09a2bc24c8",
    "evidenceSetSha256": [
      "15e4fed13758e22691f68f7ea54dae0c292a63e5aa73a278a8fc3dfdae7349ac"
    ],
    "inputTokensBpe": 5969,
    "evidencePosition": "back"
  },
  {
    "questionId": "4aa9b60c0ccd379c6fb089c84a6c7b872ee9ec4f",
    "paperId": "1906.00790",
    "question": "What set of approaches to hashtag segmentation are proposed?",
    "inputSha256": "a70379a31842d41bd2f5fc1f3c6ce71ebe6616a4b4d3ca2054cfb4d6015b945d",
    "evidenceSetSha256": [
      "df51c1800adbfe51788e256a744ea3131bf3d82a04e497e70db7da8a5e880ea0"
    ],
    "inputTokensBpe": 5576,
    "evidencePosition": "front"
  },
  {
    "questionId": "cc850bc8245a7ae790e1f59014371d4f35cd46d7",
    "paperId": "1703.10344",
    "question": "How do they determine the exact section to use the input article?",
    "inputSha256": "7421b6b4793684b7097b3ce150fbaad718dd921cf3664a3bc0985e6a5fd1266a",
    "evidenceSetSha256": [
      "8e917141a19128f7ae64cb549734c0021a5d16e1e2cdd0a9346a0cc76e36f966"
    ],
    "inputTokensBpe": 10895,
    "evidencePosition": "middle"
  },
  {
    "questionId": "b591853e938984e6069d738371500ebdec50d256",
    "paperId": "1611.01576",
    "question": "What sentiment classification dataset is used?",
    "inputSha256": "b33dca4e40588ceeb0b1af5a0a9da43f66de7061dd11fb94a342d1e5a6518f20",
    "evidenceSetSha256": [
      "fafe245a0ecb8a5a9c993cb16fce807db715c8ccef076037f8334f47f96af88b",
      "1f36d0411c115eb274ec5299402969c295c18936b12df94b9c46125e7a523226"
    ],
    "inputTokensBpe": 4953,
    "evidencePosition": "middle"
  },
  {
    "questionId": "7006c66a15477b917656f435d66f63760d33a304",
    "paperId": "1805.06966",
    "question": "by how much did nus outperform abus?",
    "inputSha256": "125bb86d9f0af9a7d284e7faed4535bc20fb1be3a0ffafd9a51b34ab65a80a6d",
    "evidenceSetSha256": [
      "b7fb9b1fabc31ae202f6209f76b9608804542da5a5d77145490bdffed6c21d9c"
    ],
    "inputTokensBpe": 6728,
    "evidencePosition": "back"
  },
  {
    "questionId": "c88a846197b72d25e04ec55f00ee3e72f655504c",
    "paperId": "1802.00396",
    "question": "Which dataset do they use?",
    "inputSha256": "f3f75debed54cf1507d691be7cacd893f6a1f78ae50c61ff0614b45957a32189",
    "evidenceSetSha256": [
      "16b7039c3791f7c9bffb146bcc7a7a8fb1aa66dc5d933cebebddabcc8a556d05"
    ],
    "inputTokensBpe": 11228,
    "evidencePosition": "front"
  },
  {
    "questionId": "8748e8f64af57560d124c7b518b853bf2711c13e",
    "paperId": "1910.12574",
    "question": "Do they report results only on English data?",
    "inputSha256": "050e75a6e84c0366addfd4ef9dbf8967f93a5df377fb497d8083a3172560ef85",
    "evidenceSetSha256": [
      "1b4f13f782d17de6864c81c194b14484f53cbb36ad6771e1e1f300b07b641cda"
    ],
    "inputTokensBpe": 6367,
    "evidencePosition": "middle"
  },
  {
    "questionId": "3d7a982c718ea6bc7e770d8c5da564fbb9d11951",
    "paperId": "1908.09246",
    "question": "How does this model overcome the assumption that all words in a document are generated from a single event?",
    "inputSha256": "d689a252b518eee19de74d7dfac9032c99d43e9c5e5c9937d7e19bf189ac788f",
    "evidenceSetSha256": [
      "53ce7b73ebc723141ee74173d2cef76959fe773dd153c68aa9922a7a10249493",
      "8b40d9bd156cc307a327e5ef1a1411b915041914b4dc51362cb5909e9f790079"
    ],
    "inputTokensBpe": 5769,
    "evidencePosition": "front"
  },
  {
    "questionId": "70a1b0f9f26f1b82c14783f1b76dfb5400444aa4",
    "paperId": "1906.07662",
    "question": "How successful are the approaches used to solve word segmentation in Vietnamese?",
    "inputSha256": "5fb00f249ab725353cc00277cddfc15781af455f3660dc280da24cd2abb79c00",
    "evidenceSetSha256": [
      "cc8017d69897a96acea4428b270e1f2cdec7a7aab86e550aee4a31c8af704254"
    ],
    "inputTokensBpe": 4814,
    "evidencePosition": "front"
  },
  {
    "questionId": "d6191c4643201262a770947fc95a613f57bedb6b",
    "paperId": "1704.04452",
    "question": "Which collections of web documents are included in the corpus?",
    "inputSha256": "5fd8ef7a94c8f015d0f9b4246a5b1b3a6fdbcb6864002b5fa2dea159ebc66d39",
    "evidenceSetSha256": [
      "d5775aaffb8002b06e072a0a3b1aff4ec6a0619861dc92f8b8ea9a83f1945eb0"
    ],
    "inputTokensBpe": 5753,
    "evidencePosition": "middle"
  },
  {
    "questionId": "b3d01ac226ee979e188a4141877a6d2a5482de98",
    "paperId": "1910.14599",
    "question": "What are the weaknesses found by non-expert annotators of current state-of-the-art NLI models?",
    "inputSha256": "00c7af5b5bf96a870d104372efa4c7f76b2c8d5c719ec020c738347a27e6835e",
    "evidenceSetSha256": [
      "9b93ee70bcfaf9801bd787bb792008c094d13259de16f15b6547d6263c14c459"
    ],
    "inputTokensBpe": 6828,
    "evidencePosition": "front"
  },
  {
    "questionId": "c497e8701060583d91bb64b9f9202d40047effc4",
    "paperId": "1907.06292",
    "question": "How do they determine if tweets have been used by journalists?",
    "inputSha256": "c259a066b0176da7aa35d1b49c79946d23057ca8e936ea463d2dece8187ce0ac",
    "evidenceSetSha256": [
      "52a72b10b6e804b87944506a7aeea9cc7395551836e7de12554618ecd4c48f11"
    ],
    "inputTokensBpe": 4990,
    "evidencePosition": "front"
  },
  {
    "questionId": "a3bb9a936f61bafb509fa12ac0a61f91abcc5106",
    "paperId": "1908.05441",
    "question": "Which datasets are used for evaluation?",
    "inputSha256": "eca5750bb779eac995a06f01d579b8aad3276a5da5b590c2eafc466ba247c156",
    "evidenceSetSha256": [
      "159d1391962bf4664b2c8233c6888c4e3bbdff9a86504cd6dd65723dd5485162",
      "da3f9da7cb5d72085d646326327ed4011e8d41162782a92e9d9628a7f6063f2b"
    ],
    "inputTokensBpe": 8227,
    "evidencePosition": "front"
  },
  {
    "questionId": "60ce4868af45753c9e124e64e518c32376f12694",
    "paperId": "1906.00790",
    "question": "How is the dataset of hashtags sourced?",
    "inputSha256": "a70379a31842d41bd2f5fc1f3c6ce71ebe6616a4b4d3ca2054cfb4d6015b945d",
    "evidenceSetSha256": [
      "1dae2aabb7dc0c3813c93eced18588a64d9ab96202250c931391cdd943cce0d1"
    ],
    "inputTokensBpe": 5576,
    "evidencePosition": "middle"
  },
  {
    "questionId": "ffa7f91d6406da11ddf415ef094aaf28f3c3872d",
    "paperId": "1906.01081",
    "question": "By how much more does PARENT correlate with human judgements in comparison to other text generation metrics?",
    "inputSha256": "58f49d00dc7318deac6793ade94b3cbce20d30b55adc3a6d289f09fbb049fb57",
    "evidenceSetSha256": [
      "30d37e3b072224de5deb14821c8fd0f7c11b942a3ffd352e1c7bd97b36540534"
    ],
    "inputTokensBpe": 5254,
    "evidencePosition": "middle"
  },
  {
    "questionId": "d859cc37799a508bbbe4270ed291ca6394afce2c",
    "paperId": "1912.03804",
    "question": "How are prominent topics idenified in Dabiq and Rumiyah?",
    "inputSha256": "bda99305877062c3c8896c151f50eafdc2f552a31f4c4db59d8ad5abf3a3f6c4",
    "evidenceSetSha256": [
      "4b87daae9cb85cb5e26040d2686652ef1eb6175c2384ed43e93acb0a47c04ef7"
    ],
    "inputTokensBpe": 5027,
    "evidencePosition": "back"
  },
  {
    "questionId": "9bb7ae50bff91571a945c1af025ed2e67714a788",
    "paperId": "1905.10851",
    "question": "What was the previous state of the art for this task?",
    "inputSha256": "c8e0570f1f1fa3ac9d44e8e4d234aa63f2e0f6a6c67eb18f80503f3f801871dd",
    "evidenceSetSha256": [
      "dd03f80122b3fea68f974fdcde28debe44bd032e5c312b5631bd57321bbd534f",
      "9799beace838bfe8b083d3e6390891f6efac2d6800fb4b2ce0bf90b311428386"
    ],
    "inputTokensBpe": 5020,
    "evidencePosition": "back"
  },
  {
    "questionId": "d28d86524292506d4b24ae2d486725a6d57a3db3",
    "paperId": "1902.09243",
    "question": "What is the ROUGE score of the highest performing model?",
    "inputSha256": "7dde4f14163f824a5ea95a03dab80b25acd854cc334120259f73678b718085ff",
    "evidenceSetSha256": [
      "2b2aef39b4ae229c676c6ffc6e2ad23d96de44e4f79eb835e446dc33a2e8ac09"
    ],
    "inputTokensBpe": 6099,
    "evidencePosition": "front"
  },
  {
    "questionId": "0fc2b5bc2ead08a6fe0280fb3a47477c6df1587c",
    "paperId": "1603.01514",
    "question": "Do they improve on state-of-the-art semantic role induction?",
    "inputSha256": "dd99196e5938225b1e3edea8a0fec6f8a611cfbde38818195c8958c7618e5d48",
    "evidenceSetSha256": [
      "e5fed51320644fd0bc21e4390dbdfabc24a1b8d187199fe126e3f61630d3c6b8"
    ],
    "inputTokensBpe": 5510,
    "evidencePosition": "middle"
  },
  {
    "questionId": "6aaf12505add25dd133c7b0dafe8f4fe966d1f1d",
    "paperId": "1808.09029",
    "question": "what previous RNN models do they compare with?",
    "inputSha256": "5b189a334f522955066b400e075755a3620b2b97fd96c0ceb9aa8e8342abfc6b",
    "evidenceSetSha256": [
      "63fd43a6141514fd68aae363466429a981e290c0705f99f4e5cf05bf4e380f9a"
    ],
    "inputTokensBpe": 4888,
    "evidencePosition": "middle"
  },
  {
    "questionId": "126ff22bfcc14a2f7e1a06a91ba7b646003e9cf0",
    "paperId": "1909.01383",
    "question": "what was the baseline?",
    "inputSha256": "b06c92a56b244bf5121de8373e2319430499994a41b620d5769b1accb0d315bd",
    "evidenceSetSha256": [
      "5d2464c3efce519c903f1d5b4806edd46bafb189e78fc12a91f9b0c3fcc57290",
      "ba881a29780ca9dfa76ce9d697b90af67d302763c18bdd8af8912c20c12aa4fc"
    ],
    "inputTokensBpe": 5516,
    "evidencePosition": "middle"
  },
  {
    "questionId": "9de2f73a3db0c695e5e0f5a3d791fdc370b1df6e",
    "paperId": "1810.04635",
    "question": "Do they use datasets with transcribed text or do they determine text from the audio?",
    "inputSha256": "8ec9ef9f9b5584fc65e9ba89d59510736bfdd30c5c2ea6f02ad842d9add911b6",
    "evidenceSetSha256": [
      "bf19f1e8f607a905971c20ea76c11e3feca9181daa9061bd03ea5f58880841db",
      "8a086c742153fafe30c91ffcf8b6417525ed01fcdc14488f6f67735cc0ec66b6"
    ],
    "inputTokensBpe": 4527,
    "evidencePosition": "front"
  },
  {
    "questionId": "7e4ef0a4debc048b244b61b4f7dc2518b5b466c0",
    "paperId": "1909.01383",
    "question": "what phenomena do they mention is hard to capture?",
    "inputSha256": "b06c92a56b244bf5121de8373e2319430499994a41b620d5769b1accb0d315bd",
    "evidenceSetSha256": [
      "6fe8eea730d562347a03a5963af5d1769e523d4828f520549016003d7d9d816b"
    ],
    "inputTokensBpe": 5516,
    "evidencePosition": "front"
  },
  {
    "questionId": "197b276d0610ebfacd57ab46b0b29f3033c96a40",
    "paperId": "1712.00991",
    "question": "What methods were used for sentence classification?",
    "inputSha256": "766b3260b82e18a919b5bab5e2e75c250c3893701cf95dfbac6f36834165b070",
    "evidenceSetSha256": [
      "8a0296f2eed8ee6283ca34775c9dddb2cb1919154094f7a0abc7e1431b04b046",
      "a6297fd8962a9ebf5109ebaa451aba95fe7ada85ab181bd8d16b0e27a567c5a4"
    ],
    "inputTokensBpe": 4556,
    "evidencePosition": "middle"
  },
  {
    "questionId": "9ee07edc371e014df686ced4fb0c3a7b9ce3d5dc",
    "paperId": "1704.06194",
    "question": "On which benchmarks they achieve the state of the art?",
    "inputSha256": "23b62654446febfd40e239d50d9aec50c1371cffccc4af38c01c470aafdef089",
    "evidenceSetSha256": [
      "836a68a350a78d1a4dde41c9bcf20b6da696a0a19c7569cb26160308ca6262e2",
      "e528a6ffc2c9f455955f58955945ba91ab5e5b628ae81a57bedefaeb1ccc747a"
    ],
    "inputTokensBpe": 7039,
    "evidencePosition": "back"
  },
  {
    "questionId": "4eaf9787f51cd7cdc45eb85cf223d752328c6ee4",
    "paperId": "1708.01464",
    "question": "what datasets did they use?",
    "inputSha256": "28d60ede5180bd461f3d9218d71a65566ea335cb51e8973788c7c7bd29b650f2",
    "evidenceSetSha256": [
      "1bed67556e1730f1284878aa677d865d995462a3bc8fd240e1e4bd9d4ddf1c85",
      "081d62edaa382b8fb59330fce18f8328a42d44acff64b81f9ab90e00dc367c27"
    ],
    "inputTokensBpe": 4538,
    "evidencePosition": "middle"
  },
  {
    "questionId": "62f27fe08ddb67f16857fab2a8a721926ecbb6fb",
    "paperId": "1909.06200",
    "question": "Who judged the irony accuracy, sentiment preservation and content preservation?",
    "inputSha256": "112fe96b53d1341c2de57775fc849f83ee4078e3d35456e1cc10f22fb336fb43",
    "evidenceSetSha256": [
      "396d85a82f06c99c865bbad9957983cda15fb12a458d1908f419e44bbcea18ac",
      "e2fd0853c754b1138cc44762b92e7bbd4ecf9078838c7845c675b65354498360"
    ],
    "inputTokensBpe": 6324,
    "evidencePosition": "back"
  },
  {
    "questionId": "3321d8d0e190d25958e5bfe0f3438b5c2ba80fd1",
    "paperId": "1908.05441",
    "question": "How was the dataset collected?",
    "inputSha256": "eca5750bb779eac995a06f01d579b8aad3276a5da5b590c2eafc466ba247c156",
    "evidenceSetSha256": [
      "e28d63b023546be1d6f1a62a3b54b03e20a5453979851bbd8ddad9bf8340edf1",
      "5d4ad1931688cce7d9d7942fe3f39aecec6d1d6cc12c5daafdbeea3738f76d3a"
    ],
    "inputTokensBpe": 8227,
    "evidencePosition": "front"
  },
  {
    "questionId": "c0bee6539eb6956a7347daa9d2419b367bd02064",
    "paperId": "2003.03106",
    "question": "Does BERT reach the best performance among all the algorithms compared?",
    "inputSha256": "1f5c5ecf7bf48acdca56816516d946ee79419bc5820050660cf4cbb6bf77110a",
    "evidenceSetSha256": [
      "ed5a440f42f26330af3d2b299b5c8b886daec4c3b1c3ae3c4ebcdc79992b334e",
      "f530464d71f50cda37cc3453932d8b7ccc12e064b30226397454bbd2e48ea32d"
    ],
    "inputTokensBpe": 6723,
    "evidencePosition": "back"
  },
  {
    "questionId": "a5e5cda1f6195ab1336855f1e39a609d61326d62",
    "paperId": "1807.07279",
    "question": "Along which dimension do the semantically related words take larger values?",
    "inputSha256": "4c5598b1a94576140cb38f06c7402103e1789731c453f1f3980b2520e40cc432",
    "evidenceSetSha256": [
      "e7e0c91009ee987a20e148583a2f0fa7f4d2be6db4cf20fc49348dad93d12d4c"
    ],
    "inputTokensBpe": 8838,
    "evidencePosition": "front"
  },
  {
    "questionId": "18942ab8c365955da3fd8fc901dfb1a3b65c1be1",
    "paperId": "1810.12196",
    "question": "Where are the hotel reviews from?",
    "inputSha256": "bbcf20b2b701e6ad9915b340ec4f5a85f0eb11361301ae8d7ed89db5d819e922",
    "evidenceSetSha256": [
      "eec0ae5f60197f0fa3cb8d2d3a0cee66b6062747b20524be881a81e4ac180445"
    ],
    "inputTokensBpe": 4969,
    "evidencePosition": "front"
  },
  {
    "questionId": "e9cfbfdf30e48cffdeca58d4ac6fdd66a8b27d7a",
    "paperId": "1704.04452",
    "question": "How were crowd workers instructed to identify important elements in large document collections?",
    "inputSha256": "5fd8ef7a94c8f015d0f9b4246a5b1b3a6fdbcb6864002b5fa2dea159ebc66d39",
    "evidenceSetSha256": [
      "582f7dc16b657abdd744b265273317ec77daf4bb52858a83cd91134502d3d23f",
      "74565d27ac7614988b5a5964eedc2310f6228347076d470dc4ecddb93b0cd756"
    ],
    "inputTokensBpe": 5753,
    "evidencePosition": "front"
  },
  {
    "questionId": "e5bc73974c79d96eee2b688e578a9de1d0eb38fd",
    "paperId": "1610.00956",
    "question": "How do they show there is space for further improvement?",
    "inputSha256": "7d2e15dd94d2abdeb303c4e44f104bc119c142326f307f55965acd977dfb6ec3",
    "evidenceSetSha256": [
      "5574a7aa9f9c2e5fc6a7ac438ef4f0f9e6792bd25250daf0da78a73253d38319",
      "9719441885c76c85a421f3e9690f57113d49e6f2cbbfb4a5a2c23ae17ac4d903"
    ],
    "inputTokensBpe": 5504,
    "evidencePosition": "back"
  },
  {
    "questionId": "b6f466e0fdcb310ecd212fd90396d9d13e0c0504",
    "paperId": "1903.11283",
    "question": "Do they introduce errors in the data or does the data already contain them?",
    "inputSha256": "51a59c8b709fa049795087ef1d98ea6fc0ec48d2755a2a3bdb80ad92bde7a3df",
    "evidenceSetSha256": [
      "f3207c81ac040b69217c6ddcae7424d5acace055038d4935fe9b8c6c09b8649f"
    ],
    "inputTokensBpe": 6483,
    "evidencePosition": "front"
  },
  {
    "questionId": "c4628d965983934d7a2a9797a2de6a411629d5bc",
    "paperId": "1906.00346",
    "question": "Is the G-BERT model useful beyond the task considered?",
    "inputSha256": "cb878986bf38fa697f5acc30c896bf4bf2322882ca1cbfc8e3398c361cf3760b",
    "evidenceSetSha256": [
      "bc8efa9b3a69975bcfdd9f8202a8b816fcab2b277bf86a6d8cc9a06f9906624e"
    ],
    "inputTokensBpe": 6405,
    "evidencePosition": "back"
  },
  {
    "questionId": "efe9bad55107a6be7704ed97ecce948a8ca7b1d2",
    "paperId": "1909.11687",
    "question": "What state-of-the-art compression techniques were used in the comparison?",
    "inputSha256": "f4d273475bb48289664cda2caf5f81649d9645face292d24965cc1a8a2800899",
    "evidenceSetSha256": [
      "42f39d293abf13ac00f3134efd5e70d93f9a8b5825a34a9849657cf52c0da235",
      "1f2b6d0c103fc4c8d6c2c9314189cdc9df3db0654407215014f4584f6b8b3ddd"
    ],
    "inputTokensBpe": 5211,
    "evidencePosition": "back"
  },
  {
    "questionId": "c22394a3fb0dbf2fc7d3a70ad6435803f5a16ebd",
    "paperId": "1908.08717",
    "question": "What tasks did they use to evaluate performance for male and female speakers?",
    "inputSha256": "09b3e11529d737592db9428805d4b7cd45491fc272e28d06cbb8ae667ef4bfbc",
    "evidenceSetSha256": [
      "7ed2b74c26f7db5b6a0d93edb4e063880eb14d73bbe945608f22dfa4bf738e68"
    ],
    "inputTokensBpe": 5574,
    "evidencePosition": "front"
  },
  {
    "questionId": "435570723b37ee1f5898c1a34ef86a0b2e8701bb",
    "paperId": "1801.10293",
    "question": "Which translation systems do they compare against?",
    "inputSha256": "c3cc5546bbc9cc91bac22f37ebb4ea2eebcd9ce95c4968b170c1642323868411",
    "evidenceSetSha256": [
      "71cb288077d97cb8d30e00520712bec1c5151cf4a3fbffa46ffd1f5d3ae30966",
      "6d0cd466289e35658c344c346424b8570ece4326617a458e68b4c174901d5a86"
    ],
    "inputTokensBpe": 5602,
    "evidencePosition": "back"
  },
  {
    "questionId": "4ef11518b40cc55d86c485f14e24732123b0d907",
    "paperId": "2001.07820",
    "question": "What are the benchmark attacking methods?",
    "inputSha256": "9035307a1e1fdfc70137b0b58bea65283626578d8912e8f9a683d0869b3a51c1",
    "evidenceSetSha256": [
      "3a7f4d60a8edecdf41bffb5a594d6d2d6749a073b6c25ac3363a21e6c42bd265"
    ],
    "inputTokensBpe": 6421,
    "evidencePosition": "front"
  },
  {
    "questionId": "8c48c726bb17a17d70ab29db4d65a93030dd5382",
    "paperId": "1905.07791",
    "question": "How much data is needed to train the task-specific encoder?",
    "inputSha256": "cfe259fd7096eecaf2435319e964e5f71a1ce066506b79ded1499ce1ae2615e1",
    "evidenceSetSha256": [
      "86432589f5b37bbc63843af5fa8bb2f73bfc4126ce27507b3d43689dad57a2e3",
      "dc6b39508f23151d3cb130cecda89bcd30a878ffad51e1efc6eda02b34c12816"
    ],
    "inputTokensBpe": 6065,
    "evidencePosition": "front"
  },
  {
    "questionId": "a87a009c242d57c51fc94fe312af5e02070f898b",
    "paperId": "1609.00425",
    "question": "What predictive model do they build?",
    "inputSha256": "daaef4b4390e9805e956f613e5c072ef504d81b3dfe8c2b250f967e798b3efed",
    "evidenceSetSha256": [
      "73542bea832cf9d85953b0a6ae98628340605deddab005beaccc8da503a7460d"
    ],
    "inputTokensBpe": 6177,
    "evidencePosition": "middle"
  },
  {
    "questionId": "8dda1ef371933811e2a25a286529c31623cca0c6",
    "paperId": "2004.02192",
    "question": "How many annotators tagged each tweet?",
    "inputSha256": "b238f3d097bf416db536ff03f4faf9a85101d4710d1e633e860dea9caad93830",
    "evidenceSetSha256": [
      "99e179fe7d0c70adb76cbf11e5c9ef9aa934799d4fdbe602f9b334dac1c9f660",
      "357b76ee2c4727d3799821fa0b79a988550ace18f4044741bb6ec52d2572a6e1"
    ],
    "inputTokensBpe": 7557,
    "evidencePosition": "middle"
  },
  {
    "questionId": "71bd5db79635d48a0730163a9f2e8ef19a86cd66",
    "paperId": "2003.04642",
    "question": "What features are absent from MRC gold standards that can result in potential lexical ambiguity?",
    "inputSha256": "7597dac8fa6b788b360dcaa526220b7379bdfc1c49f8ab065b4d280b4e71d673",
    "evidenceSetSha256": [
      "de2f9ee95db57966d296260f24929fbed8835d32979b4a6d256daa9eb16e2aa6",
      "e3e6fa08ab633541fa7408e990e6f42fd33c3b04b9a5c4ba4074072686b3f53d"
    ],
    "inputTokensBpe": 7073,
    "evidencePosition": "middle"
  },
  {
    "questionId": "75ff6e425ce304a35f18c0230c0d13d3913a31a9",
    "paperId": "1912.13337",
    "question": "Is WordNet useful for taxonomic reasoning for this task?",
    "inputSha256": "07f35485c40bfe444e2a1f8b58b097b45aae458368a72c20e7ea2debda8204f9",
    "evidenceSetSha256": [
      "4f9df2b563e7e05a5a047f65d5d405b5d4f80bab947189e9338125ee733e694f"
    ],
    "inputTokensBpe": 9961,
    "evidencePosition": "front"
  },
  {
    "questionId": "a4d115220438c0ded06a91ad62337061389a6747",
    "paperId": "1809.01202",
    "question": "What types of social media did they consider?",
    "inputSha256": "7763afc9f3e570962b8e6d4c2abdae788f6e6f0db88cf7cdcba51160b14d711b",
    "evidenceSetSha256": [
      "784dbb00e7870e0b439d0c61abfd811cbb508e803a14a7e623cf6f6e2708df29"
    ],
    "inputTokensBpe": 5493,
    "evidencePosition": "middle"
  },
  {
    "questionId": "861187338c5ad445b9acddba8f2c7688785667b1",
    "paperId": "1912.04961",
    "question": "Is the data de-identified?",
    "inputSha256": "e878cc5d484ccba1fce0c578e98efdfadf1876ee88532bf8a122a51fc1818f82",
    "evidenceSetSha256": [
      "922fe80bb11042329e7e5d7f3aca7675bdf64bbbe31e5a22e23769456f9bfa42"
    ],
    "inputTokensBpe": 6821,
    "evidencePosition": "front"
  },
  {
    "questionId": "7bd6a6ec230e1efb27d691762cc0674237dc7967",
    "paperId": "1808.09029",
    "question": "what data did they use?",
    "inputSha256": "5b189a334f522955066b400e075755a3620b2b97fd96c0ceb9aa8e8342abfc6b",
    "evidenceSetSha256": [
      "b894e01b08af0ac7f109bb95596a8b3e504ac4a8e03d159748c3ee67ecc0d4c2"
    ],
    "inputTokensBpe": 4888,
    "evidencePosition": "middle"
  },
  {
    "questionId": "e2db361ae9ad9dbaa9a85736c5593eb3a471983d",
    "paperId": "1908.10084",
    "question": "What other sentence embeddings methods are evaluated?",
    "inputSha256": "93d97c33a329d46219104cbc7f30d5f72b727ecc9e65daa009428b236c2a5c54",
    "evidenceSetSha256": [
      "7cc01babb42c8529e1f225f1060557b76208f40076de24274d940a9c4e905a6f"
    ],
    "inputTokensBpe": 6061,
    "evidencePosition": "back"
  },
  {
    "questionId": "81d193672090295e687bc4f4ac1b7a9c76ea35df",
    "paperId": "2001.01269",
    "question": "What baseline method is used?",
    "inputSha256": "3037c0af0874a247465e1f976d109ed9a4726b5d47ef9f93d38a0885e60d6426",
    "evidenceSetSha256": [
      "70d91a9bfd9622204a8407f97538999ab195bb4e7e8781f750e632a3a4b947e2",
      "1ba38ec8d70e538e7a6db771840e1b77ffb22ce410750a32e5e2e00517701ede"
    ],
    "inputTokensBpe": 5327,
    "evidencePosition": "front"
  },
  {
    "questionId": "b65a83a24fc66728451bb063cf6ec50134c8bfb0",
    "paperId": "1706.01678",
    "question": "How are sentences selected from the summary graph?",
    "inputSha256": "af2c55b4a507119ab311a4ac77d2757543210ff71105fe621d11b4ec9bda4e92",
    "evidenceSetSha256": [
      "77af433a6101299c30ba367789ad6d861b61e6892055f33e18662d32cab0761b",
      "d007664ca9e6b45589556744c7c0eb0291e6d3c44733552dcec8d9befbb618e7"
    ],
    "inputTokensBpe": 5992,
    "evidencePosition": "front"
  },
  {
    "questionId": "ae7c93646aa5f3206cd759904965b4d484d12f83",
    "paperId": "1909.03582",
    "question": "What is this method improvement over the best performing state-of-the-art?",
    "inputSha256": "0c68f407d972256d4ce0bd4c8aa7da81b50125afea9c58d6836b141728097723",
    "evidenceSetSha256": [
      "2975602ebcf9ec7a74ee173e37141c21d45a5116e94cd5daa431cccae34ceb6a"
    ],
    "inputTokensBpe": 6770,
    "evidencePosition": "back"
  },
  {
    "questionId": "d4db7df65aa4ece63e1de813e5ce98ce1b4dbe7f",
    "paperId": "1909.10012",
    "question": "How do profile changes vary for influential leads and their followers over the social movement?",
    "inputSha256": "59f89e33729a40eac3f4f5b793d5ff6936b72b90beb7c0980c1317304b1adb50",
    "evidenceSetSha256": [
      "f8cd5dff2b284549631b9d4a977cae264cb188e52ea28f360de8f80a598403e2"
    ],
    "inputTokensBpe": 7094,
    "evidencePosition": "middle"
  },
  {
    "questionId": "0ba3ea93eef5660a79ea3c26c6a270eac32dfa4c",
    "paperId": "1710.07960",
    "question": "Did they use a crowdsourcing platform for annotations?",
    "inputSha256": "885e297068e9583dae7c18a527b0820fb240bb299ac20b1fe4c6c0da309fd80c",
    "evidenceSetSha256": [
      "80ef44ee2dfda1a39facd9f17ae553c166c4d91c0591d00a0a1c350415b547da"
    ],
    "inputTokensBpe": 5165,
    "evidencePosition": "back"
  },
  {
    "questionId": "49eb52b3ec0647e165a5e41488088c80a20cc78f",
    "paperId": "1905.10851",
    "question": "What aspects of discussion are relevant to instructor intervention, according to the attention mechanism?",
    "inputSha256": "c8e0570f1f1fa3ac9d44e8e4d234aa63f2e0f6a6c67eb18f80503f3f801871dd",
    "evidenceSetSha256": [
      "faf80eeb336130f627696d1659eef491ea7c79fd57f64917747579b110e4ccc8"
    ],
    "inputTokensBpe": 5020,
    "evidencePosition": "back"
  },
  {
    "questionId": "111afb77cfbf4c98e0458606378fa63a0e965e36",
    "paperId": "1603.01514",
    "question": "Overall, does having parallel data improve semantic role induction across multiple languages?",
    "inputSha256": "dd99196e5938225b1e3edea8a0fec6f8a611cfbde38818195c8958c7618e5d48",
    "evidenceSetSha256": [
      "675eb59b189f7f44d3b73fc886321fb0421a158a175d9d71c0b905fbc7a0813b",
      "8d268ab563fc1adc027aff3162e20e53713e76559afe47e68572516c66764ba0"
    ],
    "inputTokensBpe": 5510,
    "evidencePosition": "back"
  },
  {
    "questionId": "0af16b164db20d8569df4ce688d5a62c861ace0b",
    "paperId": "1908.06264",
    "question": "what were the baselines?",
    "inputSha256": "1fde9798ea5dc65477ab0c3e3c7b60e60289d39b9e0c88aeb06c9ff076a5d0af",
    "evidenceSetSha256": [
      "678e4cf22f8ca74b3e37b2786c59c19f5434933f321b40ccbb2b13df40a3597f",
      "3a518936af54090d29a09a25dcdb8038ec050536c42ff87a7342bfd8e0d998cc"
    ],
    "inputTokensBpe": 4715,
    "evidencePosition": "back"
  },
  {
    "questionId": "ca5a82b54cb707c9b947aa8445aac51ea218b23a",
    "paperId": "2001.02284",
    "question": "How does the IPA label data after interacting with users?",
    "inputSha256": "a66c9215ca842646f6a4a74059e9b145178b5bd76b6d1d8f48c24cb814868aa2",
    "evidenceSetSha256": [
      "3153995a75958dfc94ad1bc913901728df8e24913352732b5dcc5b67a995e102"
    ],
    "inputTokensBpe": 9066,
    "evidencePosition": "middle"
  },
  {
    "questionId": "5fda8539a97828e188ba26aad5cda1b9dd642bc8",
    "paperId": "1910.14537",
    "question": "How better is performance compared to previous state-of-the-art models?",
    "inputSha256": "82d5cb4720cb529af03c98038027780ce6e71a3e0cb4e68ec316c7a3008cd2eb",
    "evidenceSetSha256": [
      "d806437dc1c268955ebfca6e458c1ccf1f0ff2d7323ab6e4b71038dea6eaa57b"
    ],
    "inputTokensBpe": 5470,
    "evidencePosition": "back"
  },
  {
    "questionId": "77c34f1033702278f7f044806c1eba0c6ecb8b04",
    "paperId": "1703.10344",
    "question": "Do they report results only on English data?",
    "inputSha256": "7421b6b4793684b7097b3ce150fbaad718dd921cf3664a3bc0985e6a5fd1266a",
    "evidenceSetSha256": [
      "1156f87bac77679d25cd11d1555243c5eb5ffde7da69c1dbe8f52c3bf3df8bd0",
      "67e7db162deda8f73a155e50801a7ac2c747be035b2aa57ed445314cbe12611d"
    ],
    "inputTokensBpe": 10895,
    "evidencePosition": "front"
  },
  {
    "questionId": "a1dac888f63c9efaf159d9bdfde7c938636f07b1",
    "paperId": "1810.12091",
    "question": "what dataset is used in this paper?",
    "inputSha256": "12988ded355f67ebaa5de6108b83fc476346e48cdac5f482d97f4e20bb102935",
    "evidenceSetSha256": [
      "4040ed676b10d67fced594318035e62e713a4e462a2642f3c1082ea2842c08c5",
      "7bc4e547574feb0fc59eb3411cd7c63753248b4cb265672d5a45e621ab933cf2"
    ],
    "inputTokensBpe": 6517,
    "evidencePosition": "back"
  },
  {
    "questionId": "220d11a03897d85af91ec88a9b502815c7d2b6f3",
    "paperId": "1909.03135",
    "question": "Why is lemmatization not necessary in English?",
    "inputSha256": "e72e3b788437da6b6f6db8427cecec6010126b0058a60a1b097ce6e598a29e5f",
    "evidenceSetSha256": [
      "00d9be124d956cf6e94c9d1f85dce004dc8b0cef2757445b47f3c9353e40f4cf"
    ],
    "inputTokensBpe": 4481,
    "evidencePosition": "front"
  },
  {
    "questionId": "114934e1a1e818630ff33ac5c4cd4be6c6f75bb2",
    "paperId": "1811.08603",
    "question": "How effective is their NCEL approach overall?",
    "inputSha256": "8afcaf8d1d9d4bf4350161b7a612f1dcca6db00f658f280098d3bc73043d4f85",
    "evidenceSetSha256": [
      "2ab7a5e5ff88a796fbdea59467d13e4a64e241ba63aebbda799e892da18202ed"
    ],
    "inputTokensBpe": 6008,
    "evidencePosition": "front"
  },
  {
    "questionId": "f03df5d99b753dc4833ef27b32bb95ba53d790ee",
    "paperId": "1712.05999",
    "question": "What are the characteristics of the accounts that spread fake news?",
    "inputSha256": "7f39a463582528535e9b6312df05c8e679a29dbcc617661fced409f17e14197f",
    "evidenceSetSha256": [
      "191a90739afb04db5d6683796c8e0ea1443874ffc83ad181b77eb45f68b089d0",
      "3c06b214f9ec7095d762ffe0ed3eefe1b614869ae1bec09402cd6fb14c746569"
    ],
    "inputTokensBpe": 4141,
    "evidencePosition": "middle"
  },
  {
    "questionId": "3415762847ed13acc3c90de60e3ef42612bc49af",
    "paperId": "1910.12795",
    "question": "How much is classification performance improved in experiments for low data regime and class-imbalance problems?",
    "inputSha256": "76be2b740070da04a52ce32de4ae2d02c1e1536b785527ccd821f9dfa622be7a",
    "evidenceSetSha256": [
      "7adc051ce3c75a0fd536810a5d127a85bb2bb150b0779962e7bcc1df089b24ee"
    ],
    "inputTokensBpe": 7397,
    "evidencePosition": "back"
  },
  {
    "questionId": "154a721ccc1d425688942e22e75af711b423e086",
    "paperId": "1803.05223",
    "question": "what crowdsourcing platform was used?",
    "inputSha256": "6d8a00faec94253d733e29dcbd5368ec706749e10c107f7ae2390cd2eb250468",
    "evidenceSetSha256": [
      "e4532b7c1f5aca4d63260107f725c9ecb683fbdf8d3ea97262006f6d52f7ad9c"
    ],
    "inputTokensBpe": 5972,
    "evidencePosition": "front"
  },
  {
    "questionId": "ef396a34436072cb3c40b0c9bc9179fee4a168ae",
    "paperId": "1705.04153",
    "question": "What tasks do they experiment with?",
    "inputSha256": "5ee332782df84b771f416f604956e25b879c951fd28c9163cee0ba6d5483d5f3",
    "evidenceSetSha256": [
      "27a92e9258727d2791addfd238c13965eae16c96d4250bd68079e7d0545dffb4"
    ],
    "inputTokensBpe": 6673,
    "evidencePosition": "front"
  },
  {
    "questionId": "37a79be0148e1751ffb2daabe4c8ec6680036106",
    "paperId": "1611.03599",
    "question": "What topic is covered in the Chinese Facebook data?",
    "inputSha256": "a41d06e4a4ea42c00aeb9b98882467a7002b51f4591a440664fa6b16b093fb1e",
    "evidenceSetSha256": [
      "9954c58a6736505de8b9bc8c3c62623a51231753997aa9f534a177b3b9356b0e",
      "6dca7a40cf9d74009b7c233ab9697f6bc21e4249b8a8d057b1b9b0edef4c3c7d"
    ],
    "inputTokensBpe": 6224,
    "evidencePosition": "middle"
  },
  {
    "questionId": "b4f881331b975e6e4cab1868267211ed729d782d",
    "paperId": "1908.04042",
    "question": "how large is the vocabulary?",
    "inputSha256": "606e911f4cc99b2ef6615584178edab0087d94daf53ad50881d486933b940d80",
    "evidenceSetSha256": [
      "10322328913a1849e61873bec3d7f56c98c14ba5178fe5c73430f64b784cd044"
    ],
    "inputTokensBpe": 4644,
    "evidencePosition": "front"
  },
  {
    "questionId": "d9980676a83295dda37c20cfd5d58e574d0a4859",
    "paperId": "1903.11437",
    "question": "what data simulation techniques were introduced?",
    "inputSha256": "b010ac2e4e190957ce5829cc738c136e04ae9b6a03df3685c24a2e93ad726678",
    "evidenceSetSha256": [
      "8a2a5827f2003a93fce0d92f250bbad4170a8a91e13dc40e5359f5776aeae567",
      "27815a878af9c073e8fa39512373b637c4057b61aa8b6be3dabefe82f525438c"
    ],
    "inputTokensBpe": 5903,
    "evidencePosition": "middle"
  },
  {
    "questionId": "bf3b27a4f4be1f9ae31319877fd0c75c03126fd5",
    "paperId": "1906.01081",
    "question": "How many people participated in their evaluation study of table-to-text models?",
    "inputSha256": "58f49d00dc7318deac6793ade94b3cbce20d30b55adc3a6d289f09fbb049fb57",
    "evidenceSetSha256": [
      "f17c2bc9b1a8de8d3cd6485b4c6ed936f7058308be37c649e4cd7f3631d7da88"
    ],
    "inputTokensBpe": 5254,
    "evidencePosition": "middle"
  },
  {
    "questionId": "22815878083ebd2f9e08bc33a5e733063dac7a0f",
    "paperId": "1909.03135",
    "question": "What other examples of morphologically-rich languages do the authors give?",
    "inputSha256": "e72e3b788437da6b6f6db8427cecec6010126b0058a60a1b097ce6e598a29e5f",
    "evidenceSetSha256": [
      "0c8139bfec9df260a8a9860baed84bde4aa1dd92669a0c785258807fb86e63d3",
      "405eedad54cc7f7bfccb00d79b0bf3c0314642f6af29b0c9a23ac5beb9ddbd51"
    ],
    "inputTokensBpe": 4481,
    "evidencePosition": "front"
  },
  {
    "questionId": "0f567251a6566f65170a1329eeeb5105932036b2",
    "paperId": "1906.00790",
    "question": "What current state of the art method was used for comparison?",
    "inputSha256": "a70379a31842d41bd2f5fc1f3c6ce71ebe6616a4b4d3ca2054cfb4d6015b945d",
    "evidenceSetSha256": [
      "52de45e3b9cc58642cd97bb2207fe472149aac4b6da9aae1cd58f0e239907054",
      "994c8119fa26ccaba8e252acf8c1f3c898283e61a9593c4b043c65502912d684"
    ],
    "inputTokensBpe": 5576,
    "evidencePosition": "front"
  },
  {
    "questionId": "bb2de20ee5937da7e3e6230e942bec7b6e8f61ee",
    "paperId": "1908.05828",
    "question": "What is the source of their dataset?",
    "inputSha256": "d569d8bcf7c7badb620063bf4095134edb3f15a158b28ba83c0de5ee917a4ae2",
    "evidenceSetSha256": [
      "5be23a079f53559c6c2ecbd646d96574b69965f25e4884c25d8938e04a14090c",
      "25b990a86f2e377e630be5182ac425c5abf9c5c0ecbec98434a669705019076a"
    ],
    "inputTokensBpe": 4469,
    "evidencePosition": "middle"
  },
  {
    "questionId": "d51dc36fbf6518226b8e45d4c817e07e8f642003",
    "paperId": "1908.05828",
    "question": "How many sentences does the dataset contain?",
    "inputSha256": "d569d8bcf7c7badb620063bf4095134edb3f15a158b28ba83c0de5ee917a4ae2",
    "evidenceSetSha256": [
      "83c664dbe6cfbd70b877b3229272769843a3fe5c5d5aa0e2ff9c9ea9d7b9f6d7"
    ],
    "inputTokensBpe": 4469,
    "evidencePosition": "middle"
  },
  {
    "questionId": "d9b6c61fc6d29ad399d27b931b6cb7b1117b314a",
    "paperId": "1809.04267",
    "question": "Where is a question generation model used?",
    "inputSha256": "2f4a04d1cee410d469eebcf7becc4053a96448beca65e997c724d05bc9cc2cb0",
    "evidenceSetSha256": [
      "e8ae49f07c1c7357507a262fc09a32bd3356428c6d61f789a06ec5bd3c51ea6b",
      "09b9483609a9b66e139649fb25ee38353f84016e12c63a8a3672d21e2e1a5994"
    ],
    "inputTokensBpe": 5969,
    "evidencePosition": "front"
  },
  {
    "questionId": "beac555c4aea76c88f19db7cc901fa638765c250",
    "paperId": "1710.03348",
    "question": "What useful information does attention capture?",
    "inputSha256": "86de51bc72e3f41ff92cd4a93cc471ece098bd927bb51640b5b067ef445a93c3",
    "evidenceSetSha256": [
      "192bd3aa90e3a54eefd8aecd0d1763f3197cd0586cd9771e36c50b37c15aa2bd",
      "a2816ce748841f8383f866d0f81ac367e688c7f4db0f05405fbed787d2001b81"
    ],
    "inputTokensBpe": 4631,
    "evidencePosition": "front"
  },
  {
    "questionId": "bc31a3d2f7c608df8c019a64d64cb0ccc5669210",
    "paperId": "1909.03405",
    "question": "What BERT model do they test?",
    "inputSha256": "5d4c4675ccb497cf0b8fc1a739625c436cf893f2702f697b08d0cad853d4df22",
    "evidenceSetSha256": [
      "f802d5a7b94353763fb1f03402556e20cc5d9926118e067030507b082b33c1ef"
    ],
    "inputTokensBpe": 6193,
    "evidencePosition": "middle"
  },
  {
    "questionId": "84bad9a821917cb96584cf5383c6d2a035358d7c",
    "paperId": "1803.05223",
    "question": "how was the data collected?",
    "inputSha256": "6d8a00faec94253d733e29dcbd5368ec706749e10c107f7ae2390cd2eb250468",
    "evidenceSetSha256": [
      "1f30f8fec34d621cc56b8af155bb553df0e17500dc8812569b78aeab395c1342"
    ],
    "inputTokensBpe": 5972,
    "evidencePosition": "front"
  },
  {
    "questionId": "7f207549c75f5c4388efc15ed28822672b845663",
    "paperId": "1908.10084",
    "question": "How much time takes its training?",
    "inputSha256": "93d97c33a329d46219104cbc7f30d5f72b727ecc9e65daa009428b236c2a5c54",
    "evidenceSetSha256": [
      "03429a04ab72261968c989afee9dc52b05f7ac05b7117c92cf6653254deb4f31"
    ],
    "inputTokensBpe": 6061,
    "evidencePosition": "front"
  },
  {
    "questionId": "eac9dae3492e17bc49c842fb566f464ff18c049b",
    "paperId": "1601.02403",
    "question": "What argument components do the ML methods aim to identify?",
    "inputSha256": "ef4d9e5adbd5b1ae77d0b817fea6749491095517674c5225f7129fe6bb1f66cb",
    "evidenceSetSha256": [
      "2a01be10090ca35a8eb5092f56ab0b8b727b5fd42178b00e4c7fc3823194d301",
      "ced03f9c71aa0f7716cb74708d91c3f508a205fc204392d6a2fcd7db034a4955"
    ],
    "inputTokensBpe": 21004,
    "evidencePosition": "middle"
  },
  {
    "questionId": "cb77d6a74065cb05318faf57e7ceca05e126a80d",
    "paperId": "1908.05828",
    "question": "What is the baseline?",
    "inputSha256": "d569d8bcf7c7badb620063bf4095134edb3f15a158b28ba83c0de5ee917a4ae2",
    "evidenceSetSha256": [
      "1633d47a6aab898ea2f6d2fd2990362668e5c562bdac7e3c7a9b009bc80c9313"
    ],
    "inputTokensBpe": 4469,
    "evidencePosition": "front"
  },
  {
    "questionId": "21548433abd21346659505296fb0576e78287a74",
    "paperId": "1909.13104",
    "question": "What dataset is used for this work?",
    "inputSha256": "773e6d3347d23380eb0d87b5d725a5f8b4dac319e31d78084991f9b5909d69a3",
    "evidenceSetSha256": [
      "846979a89ef5a57a3c41348e5581149aeaab8e03659a21cc7ad62698b71ad2b4",
      "57519c45174b2a38211a3914082697be2cf54bc80e1cc3c995a7ed695d57e8a7"
    ],
    "inputTokensBpe": 4417,
    "evidencePosition": "front"
  },
  {
    "questionId": "044f922604b4b3f42ae381419fd5cd5624fa0637",
    "paperId": "1710.03348",
    "question": "In what cases is attention different from alignment?",
    "inputSha256": "86de51bc72e3f41ff92cd4a93cc471ece098bd927bb51640b5b067ef445a93c3",
    "evidenceSetSha256": [
      "7b24379bfa436e923480d7fba9e102f083357cea159f50e6910ef6f43ba0fffa",
      "83c888601b048cf65cb56f527f00d4c250d3021515adec36b28cd8035ea55a5f"
    ],
    "inputTokensBpe": 4631,
    "evidencePosition": "middle"
  },
  {
    "questionId": "f875337f2ecd686cd7789e111174d0f14972638d",
    "paperId": "1611.02988",
    "question": "Which existing benchmarks did they compare to?",
    "inputSha256": "8d7869c6a32138e4db69f8cc766b2a0f10d55afc6d839ca404f896e5d4c3aad6",
    "evidenceSetSha256": [
      "c0ba26102cf0baa118a829a2b683a85d2314117d33c1005090e80db66b54c7a6",
      "1bd6cef363dd394bef4a1bd32bee8ec8db52bc163cf25df88494ffa60fff9a8a"
    ],
    "inputTokensBpe": 4569,
    "evidencePosition": "front"
  },
  {
    "questionId": "b962cc817a4baf6c56150f0d97097f18ad6cd9ed",
    "paperId": "1810.12196",
    "question": "What kind of questions are present in the dataset?",
    "inputSha256": "bbcf20b2b701e6ad9915b340ec4f5a85f0eb11361301ae8d7ed89db5d819e922",
    "evidenceSetSha256": [
      "41940ab880f101bbdccfb9d433dcc0337d0d3cb8b1dcab2d470ee09e4a35ab3e"
    ],
    "inputTokensBpe": 4969,
    "evidencePosition": "middle"
  },
  {
    "questionId": "73a7acf33b26f5e9475ee975ba00d14fd06f170f",
    "paperId": "1903.03530",
    "question": "What labels do they create on their dataset?",
    "inputSha256": "4afcf190e58ed3be6812e89e0d4b373b6baeebaf9ec63aabfb60c39c3cdf4f33",
    "evidenceSetSha256": [
      "846a1c198ec646929cb2824cffb3c84e3a4e5baf4ffc50ef704167f821e15f69",
      "403c3636ffebab3c7024af2282808f472984bbdc4a343aa15a54abfd3cfc304d"
    ],
    "inputTokensBpe": 4887,
    "evidencePosition": "front"
  },
  {
    "questionId": "891c2001d6baaaf0da4e65b647402acac621a7d2",
    "paperId": "1909.00512",
    "question": "How do they calculate a static embedding for each word?",
    "inputSha256": "efb162865bcb7145f42c37465d5046e71a005244bc4d7321ff8fa2556b9df2a3",
    "evidenceSetSha256": [
      "1ea24fac95f04ea8cfb94c4035655129b6f38f0a2801ed0df9d4034d0a748bd3"
    ],
    "inputTokensBpe": 6486,
    "evidencePosition": "back"
  },
  {
    "questionId": "c01784b995f6594fdb23d7b62f20a35ae73eaa77",
    "paperId": "2001.08868",
    "question": "How do the authors show that their learned policy generalize better than existing solutions to unseen games?",
    "inputSha256": "4898a51527fe5408c3c440939047eecec02ef50b84d9716ca9130a2b32ca7cac",
    "evidenceSetSha256": [
      "b528a8be5cf48bf201f5b81142bedac20c10114744e4354856ccbe312b84a825"
    ],
    "inputTokensBpe": 7614,
    "evidencePosition": "back"
  },
  {
    "questionId": "f7a89b9cd2792f23f2cb43d50a01b8218a6fbb24",
    "paperId": "1802.07862",
    "question": "Which types of named entities do they recognize?",
    "inputSha256": "887da54c1a839aa42bea35249fad9daa6110ab647733bbde69842ca642d13651",
    "evidenceSetSha256": [
      "7ae427b56594b8d5dad1f971a2aacf713a46e338d03b5bd7362e5efe799d6eb3"
    ],
    "inputTokensBpe": 5864,
    "evidencePosition": "middle"
  },
  {
    "questionId": "53dfcd5d7d2a81855ec1728f0d8e6e24c5638f1e",
    "paperId": "1907.06292",
    "question": "What evaluation metrics do they use?",
    "inputSha256": "c259a066b0176da7aa35d1b49c79946d23057ca8e936ea463d2dece8187ce0ac",
    "evidenceSetSha256": [
      "bb4669c1b432ba14afc1d0de4adc5deb3797499cc3be3b8596962eafa774c485"
    ],
    "inputTokensBpe": 4990,
    "evidencePosition": "middle"
  },
  {
    "questionId": "88e5d37617e14d6976cc602a168332fc23644f19",
    "paperId": "1909.01362",
    "question": "What are two datasets model is applied to?",
    "inputSha256": "e0e3721003e8852ef6e878fa96fc5182d0f472e3196a7c7032854197ffbfbeae",
    "evidenceSetSha256": [
      "f63d1a87f9c9d2e09ff24e193ee2861bbdfaccfd783b5ccbb8d96f1c753ee673",
      "622e4b62f1808d02e9a90567fb1810b6fe0ca9f839a7897ac024aa85a5fedce7"
    ],
    "inputTokensBpe": 6936,
    "evidencePosition": "front"
  },
  {
    "questionId": "ef7212075e80bf35b7889dc8dd52fcbae0d1400a",
    "paperId": "1806.05504",
    "question": "Why are current ELS's not sufficiently effective?",
    "inputSha256": "22e9512a4ca435c5b74913e865a8f0a361cabea17d32d7795e1f12bc9d3e6e75",
    "evidenceSetSha256": [
      "cd187b7c66338a2b8d3dcab8e387e8eb84b5533c1285e9822f21884d0ea7d7e8",
      "90214e2b8c87f30e53d6234a06d8c39d05b0bc51f211905279eb39b8467efc63"
    ],
    "inputTokensBpe": 5583,
    "evidencePosition": "front"
  },
  {
    "questionId": "01e2d10178347d177519f792f86f25575106ddc7",
    "paperId": "1703.07476",
    "question": "What datasets are used to assess the performance of the system?",
    "inputSha256": "b4d1e93ba972bbc07e0f02246746e82890ee80456bfdc062d074b29d95fb395f",
    "evidenceSetSha256": [
      "424f703341583de8f0a2886e35c12b0e8c3c2a29c3b062971a5fa3305d3a8952",
      "121519029ecee9da623d07e91519375356fe45f3dbf5bca220ae84d4ab0ca41a"
    ],
    "inputTokensBpe": 4993,
    "evidencePosition": "middle"
  },
  {
    "questionId": "ee417fea65f9b1029455797671da0840c8c1abbe",
    "paperId": "2001.02284",
    "question": "Do they use off-the-shelf NLP systems to build their assitant?",
    "inputSha256": "a66c9215ca842646f6a4a74059e9b145178b5bd76b6d1d8f48c24cb814868aa2",
    "evidenceSetSha256": [
      "391175a27b7286dc8f57216ce5c48c331554e14d746e7fae51de4d9a6f26aa2f"
    ],
    "inputTokensBpe": 9066,
    "evidencePosition": "front"
  },
  {
    "questionId": "41b2355766a4260f41b477419d44c3fd37f3547d",
    "paperId": "1910.12574",
    "question": "What are the existing biases?",
    "inputSha256": "050e75a6e84c0366addfd4ef9dbf8967f93a5df377fb497d8083a3172560ef85",
    "evidenceSetSha256": [
      "19cb1a45523b91eb10fd2a421a74a69bcc706850d853dd933c28b68a0b15dc57",
      "8edbc741821c757d0d9738f00f4f26603eff336a5c030e5b3be67239a7dfd372"
    ],
    "inputTokensBpe": 6367,
    "evidencePosition": "front"
  },
  {
    "questionId": "2c78993524ca62bf1f525b60f2220a374d0e3535",
    "paperId": "1809.00540",
    "question": "What are the sources of the datasets?",
    "inputSha256": "85a1f620bad283c3fd17114a478d831f29d23967671e28e96ceee968aeccd6f1",
    "evidenceSetSha256": [
      "3f826ddc35d4660e6b9f56e2fe31310175579264741caa8585bec67c05b7dd1a",
      "0b86972b493b36b3545c70ae8a168d4e913af029ca029fa16f2666e7f5f79fbe"
    ],
    "inputTokensBpe": 4417,
    "evidencePosition": "middle"
  },
  {
    "questionId": "c74185bced810449c5f438f11ed6a578d1e359b4",
    "paperId": "1909.01362",
    "question": "What labels for antisocial events are available in datasets?",
    "inputSha256": "e0e3721003e8852ef6e878fa96fc5182d0f472e3196a7c7032854197ffbfbeae",
    "evidenceSetSha256": [
      "a9f0dc3e09cd6aef90c081af33a74ffb7be8496e3b377a65b84e4acf1b5da34b"
    ],
    "inputTokensBpe": 6936,
    "evidencePosition": "middle"
  },
  {
    "questionId": "fb1227b3681c69f60eb0539e16c5a8cd784177a7",
    "paperId": "1703.10344",
    "question": "What features are used to represent the salience and relative authority of entities?",
    "inputSha256": "7421b6b4793684b7097b3ce150fbaad718dd921cf3664a3bc0985e6a5fd1266a",
    "evidenceSetSha256": [
      "b0ce0737dc1f7d676e52708253de947af1c3b99fec95f4bd4f6f7ae943c95000",
      "fb4f1cd5dc122a6371f104672b1ed4c4bae1638dbd5448171f1e2d6147504ed8"
    ],
    "inputTokensBpe": 10895,
    "evidencePosition": "middle"
  },
  {
    "questionId": "cb6a8c642575d3577d1840ca2f4cd2cc2c3397c5",
    "paperId": "1804.07789",
    "question": "Do they use pretrained embeddings?",
    "inputSha256": "b8c444c92eb1f6b2e1ea34e33d46ce81d7df82fa1a8faea2b454284eb2ebf0be",
    "evidenceSetSha256": [
      "080e723d95fac5000643384ecb1faf62ace1913e68cc97933e98f9bce2ab592b"
    ],
    "inputTokensBpe": 6287,
    "evidencePosition": "back"
  },
  {
    "questionId": "d9412dda3279729e95fcb35cbed09e61577a896e",
    "paperId": "1809.06537",
    "question": "what evaluation metrics are reported?",
    "inputSha256": "4931b2888885da84f1245f11449b19cb6cb8ec2f2882df4e1a3ad44d4a534b0b",
    "evidenceSetSha256": [
      "55eec7dc5a22fe8f528d32e6a811bb2d43348fe8bf842f7b2632bc91d4fcced2"
    ],
    "inputTokensBpe": 5906,
    "evidencePosition": "back"
  },
  {
    "questionId": "d6ea7a30b0b61ae126b00b59d2a14fff2ef887bf",
    "paperId": "1907.01468",
    "question": "What approaches do they use towards text analysis?",
    "inputSha256": "cff128c762dd972ab04bbdf3fec665a1a0268698cc01b66066af6884e47557d5",
    "evidenceSetSha256": [
      "af6003be334cf19406296da1efd8d7e76d5e66c02e76dada9dc2f77f3181d48b"
    ],
    "inputTokensBpe": 10884,
    "evidencePosition": "front"
  },
  {
    "questionId": "1d197cbcac7b3f4015416f0152a6692e881ada6c",
    "paperId": "1910.06036",
    "question": "How they extract \"structured answer-relevant relation\"?",
    "inputSha256": "be477d2dd2fce982067d85d534544f75ade3e4bc288c046a6d0f5895f8381522",
    "evidenceSetSha256": [
      "206a018e587cf185610c2a0374be6d5a60075dc9cda9cac781b88a00083b2898",
      "81f7eaafaeca49aa985d8494bba95cf85d12e8205d7937e069d26264f6cb7b52"
    ],
    "inputTokensBpe": 6030,
    "evidencePosition": "front"
  },
  {
    "questionId": "1e185a3b8cac1da939427b55bf1ba7e768c5dae4",
    "paperId": "1910.07601",
    "question": "What classification baselines are used for comparison?",
    "inputSha256": "632d671e79012a917adeca083ccd6e431fa6047601f274c7b9dcb09b8723b4cd",
    "evidenceSetSha256": [
      "0eac04609633af52c9e528a4831d89aea16a33526a520bc32725c7add6e6dc31",
      "2be5107372dcb84972a9ab735ed04943864ae9decf53bbdfe81f709771465882"
    ],
    "inputTokensBpe": 5477,
    "evidencePosition": "middle"
  },
  {
    "questionId": "c2cb6c4500d9e02fc9a1bdffd22c3df69655189f",
    "paperId": "1810.12085",
    "question": "did they compare with other extractive summarization methods?",
    "inputSha256": "3bfbf2e1bb6568c9cc6edfd9cbab028690a838d22a9112fcd2b3d6d448538b9c",
    "evidenceSetSha256": [
      "c74b302927336af1fc1dba2630dbad3f90e46317127a6ffdf1a0f13f746d28dd"
    ],
    "inputTokensBpe": 4161,
    "evidencePosition": "back"
  },
  {
    "questionId": "07b70b2b799b9efa630e8737df8b1dd1284f032c",
    "paperId": "1901.01010",
    "question": "How large is their data set?",
    "inputSha256": "9c05d4692b345f5527c8d1fbcc72f215b6bebaa9ff89fc4282110e4bc4c2f26f",
    "evidenceSetSha256": [
      "d8eca71c0dec1c7384d1786ea91c7634c4cf36f2574d83f30e619e83011466b7"
    ],
    "inputTokensBpe": 5893,
    "evidencePosition": "middle"
  },
  {
    "questionId": "f8da63df16c4c42093e5778c01a8e7e9b270142e",
    "paperId": "2002.04095",
    "question": "How is segmentation quality evaluated?",
    "inputSha256": "dd6661177ad92af44a53bd31de9b23852f8da158ddda0d4ac0a20f45d35660f2",
    "evidenceSetSha256": [
      "ef6f83658d726476c5afd1a254d270a649ca65c904f0c71a2343948c5bb1d3dd",
      "290c1aec11c02d1910cd35eadc8666ac236f4aad09cbba5dc69c4f52ae98f3f8"
    ],
    "inputTokensBpe": 5358,
    "evidencePosition": "middle"
  },
  {
    "questionId": "53014cfb506f6fffb22577bf580ae6f4d5317ce5",
    "paperId": "1908.08345",
    "question": "What are the datasets used for evaluation?",
    "inputSha256": "c42c60cebe238753f5c10fc2ef09314d4bd3c3677bd95b67b05d2cacaaa035dc",
    "evidenceSetSha256": [
      "771704a4d538b9e4fa560dfca22a642bbeff5e7bda9af3d01f3472bae4c8989d"
    ],
    "inputTokensBpe": 6974,
    "evidencePosition": "middle"
  },
  {
    "questionId": "021bfb7e180d67112b74f05ecb3fa13acc036c86",
    "paperId": "1703.07476",
    "question": "How is the vocabulary of word-like or phoneme-like units automatically discovered?",
    "inputSha256": "b4d1e93ba972bbc07e0f02246746e82890ee80456bfdc062d074b29d95fb395f",
    "evidenceSetSha256": [
      "46ef16de348a6ed63dbd79ac4b07b832d6d90de78a92bd8d2cb84240c4ec0681"
    ],
    "inputTokensBpe": 4993,
    "evidencePosition": "front"
  },
  {
    "questionId": "2dbf6fe095cd879a9bf40f110b7b72c8bdde9475",
    "paperId": "1709.10367",
    "question": "What hierarchical modelling approach is used?",
    "inputSha256": "b29920197dcd897337353c91829e334d3acb195caf275b0e08a66e8381495fac",
    "evidenceSetSha256": [
      "638fa79f7e0d086d513b2f5f8b0c0b6f31b578280de23dd69e656a9267fca155"
    ],
    "inputTokensBpe": 4647,
    "evidencePosition": "front"
  },
  {
    "questionId": "88e62ea7a4d1d2921624b8480b5c6b50cfa5ad42",
    "paperId": "1609.00559",
    "question": "What is a second order co-ocurrence matrix?",
    "inputSha256": "5bbbfef6db7b11aaa468212345394e18113b58977265dd7ad0e40b27da239749",
    "evidenceSetSha256": [
      "c54cbc38d59610015dd7ec73788ae35d948de84f9c78734ae1b91bc9fdbd92ed",
      "b75d54ccc1dd65a63f2bd2fe49861385618a65d31113c62fd031dbeef1ae921f"
    ],
    "inputTokensBpe": 5979,
    "evidencePosition": "front"
  },
  {
    "questionId": "79a44a68bb57b375d8a57a0a7f522d33476d9f33",
    "paperId": "1912.10011",
    "question": "Which qualitative metric are used for evaluation?",
    "inputSha256": "e9ccfdd6361e46ab4e6682386e94f773eb3f2eda64881687d19b0154ea60efcc",
    "evidenceSetSha256": [
      "b216c3a4a2a46cc57ffbb4be94cd5f4ea8f42250c3c8fd311b0403d3bca6b318"
    ],
    "inputTokensBpe": 7482,
    "evidencePosition": "middle"
  },
  {
    "questionId": "e35a7f9513ff1cc0f0520f1d4ad9168a47dc18bb",
    "paperId": "1805.07133",
    "question": "what was the baseline?",
    "inputSha256": "9646131565ab10fe8bca647db426cf0093c7f2399063394ce9931fdcdcf7bcc1",
    "evidenceSetSha256": [
      "a7f8137509397ed712230683691ecca2432ab524acf6823275e739f2b00cac02",
      "3a2f06ac3055cbb147f8f7ce70bc1ea4f0128525ea8f76113369bdbdcc068434"
    ],
    "inputTokensBpe": 5747,
    "evidencePosition": "back"
  },
  {
    "questionId": "509af1f11bd6f3db59284258e18fdfebe86cae47",
    "paperId": "1912.08960",
    "question": "How is diversity measured?",
    "inputSha256": "9bd63095b3d72561ffc3030ea2e79ad7f8b169c93dc1342201be26ab99729f64",
    "evidenceSetSha256": [
      "fe06c13d5faa37d28d85d654780be4288a4f1282ad4fbee2d5aa61bf9fae190c",
      "f4a38d410f800d7dbb740f818ca8cb4949d3d06a25d7a22b475aa25ea85b665a"
    ],
    "inputTokensBpe": 4766,
    "evidencePosition": "middle"
  },
  {
    "questionId": "72f7ef55e150e16dcf97fe443aff9971a32414ef",
    "paperId": "1911.02855",
    "question": "What are method's improvements of F1 w.r.t. baseline BERT tagger for Chinese POS datasets?",
    "inputSha256": "25f3d29d2f75218f2ef3cb4d6f0cd557516816f9a35a02010a8fd9dccf0f5ae4",
    "evidenceSetSha256": [
      "9cd52682357ec2755b3432cc4bdd560d2df71c96f3938bcb73b3ebc3388e36b3",
      "2449fa427eb06467a28c283c4cf56ab7f5786dc5ae021e36f4057440b8739af4"
    ],
    "inputTokensBpe": 6226,
    "evidencePosition": "middle"
  },
  {
    "questionId": "b249b60a8c94d0e40d65f1ffdfcac527dab57516",
    "paperId": "1906.00790",
    "question": "Do the hashtag and SemEval datasets contain only English data?",
    "inputSha256": "a70379a31842d41bd2f5fc1f3c6ce71ebe6616a4b4d3ca2054cfb4d6015b945d",
    "evidenceSetSha256": [
      "1dae2aabb7dc0c3813c93eced18588a64d9ab96202250c931391cdd943cce0d1"
    ],
    "inputTokensBpe": 5576,
    "evidencePosition": "middle"
  },
  {
    "questionId": "567dc9bad8428ea9a2658c88203a0ed0f8da0dc3",
    "paperId": "1908.05828",
    "question": "What is the best model?",
    "inputSha256": "d569d8bcf7c7badb620063bf4095134edb3f15a158b28ba83c0de5ee917a4ae2",
    "evidenceSetSha256": [
      "7f0019f37e1f0f4b9e956ffa5dc66d103abd118e12b5cdd23d184479c4c54033"
    ],
    "inputTokensBpe": 4469,
    "evidencePosition": "back"
  },
  {
    "questionId": "9ecde59ffab3c57ec54591c3c7826a9188b2b270",
    "paperId": "2003.04642",
    "question": "What modern MRC gold standards are analyzed?",
    "inputSha256": "7597dac8fa6b788b360dcaa526220b7379bdfc1c49f8ab065b4d280b4e71d673",
    "evidenceSetSha256": [
      "17f5627e586e7f3f65e959c5fba210c42e4b22ba63411cc92b5aa3f8fe6eec48"
    ],
    "inputTokensBpe": 7073,
    "evidencePosition": "middle"
  },
  {
    "questionId": "6d1217b3d9cfb04be7fcd2238666fa02855ce9c5",
    "paperId": "1908.05828",
    "question": "Which models are used to solve NER for Nepali?",
    "inputSha256": "d569d8bcf7c7badb620063bf4095134edb3f15a158b28ba83c0de5ee917a4ae2",
    "evidenceSetSha256": [
      "1633d47a6aab898ea2f6d2fd2990362668e5c562bdac7e3c7a9b009bc80c9313",
      "7cb2bfcb4b16828404b6398f3af3245c80c673aa8607d9f48ec4864bf7759279"
    ],
    "inputTokensBpe": 4469,
    "evidencePosition": "front"
  },
  {
    "questionId": "664db503509b8236bc4d3dc39cebb74498365750",
    "paperId": "1912.10011",
    "question": "What is quantitative improvement of proposed method (the best variant) w.r.t. baseline (the best variant)?",
    "inputSha256": "e9ccfdd6361e46ab4e6682386e94f773eb3f2eda64881687d19b0154ea60efcc",
    "evidenceSetSha256": [
      "756de8a5f7a3e296b28c840f577a0d64cf2092662753d11d0f513aed705c1a9c"
    ],
    "inputTokensBpe": 7482,
    "evidencePosition": "back"
  },
  {
    "questionId": "dcc1115aeaf87118736e86f3e3eb85bf5541281c",
    "paperId": "1706.01875",
    "question": "What classifier did they use?",
    "inputSha256": "9d462898c833d06a008b059d07d6cfe950a0f48d02b3a993701a44f858ecca53",
    "evidenceSetSha256": [
      "08d8123fef33707a1b8faf02d0f4e3d0085409c09dfb57d650990d976da1fe40"
    ],
    "inputTokensBpe": 4580,
    "evidencePosition": "middle"
  },
  {
    "questionId": "36ae003c7cb2a1bbfa90b89c671bc286bd3b3dfd",
    "paperId": "1910.08293",
    "question": "How does dataset model character's profiles?",
    "inputSha256": "587909ae53cea6b61f657b4c79154fb97b906717f053ee7ba1dbd599ded2ca6a",
    "evidenceSetSha256": [
      "fa9c136639c86c41563df97b7ca261102860d12502c877eaba84fc12fb148013"
    ],
    "inputTokensBpe": 7520,
    "evidencePosition": "front"
  },
  {
    "questionId": "aef607d2ac46024be17b1ddd0ed3f13378c563a6",
    "paperId": "1909.00326",
    "question": "How do they measure which words are under-translated by NMT models?",
    "inputSha256": "781eef02b6d5225b85de1af3c70dee2e62de47b9cc4ca6a07b9070c9561205b8",
    "evidenceSetSha256": [
      "2cd8f818773ad0b2eb62beadb6653824d08bcc3e12cf5bc2c34400f56059f00c",
      "2e82ab7abda1cef0a1e7f665c0108c1da451a80129d794b14f0965dff3ad90b1"
    ],
    "inputTokensBpe": 6260,
    "evidencePosition": "back"
  },
  {
    "questionId": "c2e475adeddcdc4d637ef0d4f5065b6a9b299827",
    "paperId": "1804.07789",
    "question": "What metrics are used for evaluation?",
    "inputSha256": "b8c444c92eb1f6b2e1ea34e33d46ce81d7df82fa1a8faea2b454284eb2ebf0be",
    "evidenceSetSha256": [
      "d90b07851c6745f6ab9bba64d19e066e044881cfc8e61dc1a9ee815a24d7ed0c"
    ],
    "inputTokensBpe": 6287,
    "evidencePosition": "back"
  },
  {
    "questionId": "f5e6f43454332e0521a778db0b769481e23e7682",
    "paperId": "1912.01214",
    "question": "what are the pivot-based baselines?",
    "inputSha256": "eaa95369a3177e1b871637522002f52044f43bf9b7d46a95b33a86ef378c3ad2",
    "evidenceSetSha256": [
      "84059eee1b99792287315099bb2f87234417b4423b320b110d4203867bb28fa7",
      "60049bacd5387b33c53cfad75e6e547e043acdfdec5bd9f821435c0abc9b56e7"
    ],
    "inputTokensBpe": 5735,
    "evidencePosition": "front"
  },
  {
    "questionId": "a616a3f0d244368ec588f04dfbc37d77fda01b4c",
    "paperId": "2003.04866",
    "question": "What are the 12 languages covered?",
    "inputSha256": "7a568bfbe96f29cf4793ca1587a854d346a7fb5a79fdd0abdb63aa37df790d75",
    "evidenceSetSha256": [
      "25d1ee4eaf9040d80710cb71e643093f12e217b0449d99c5836675babfe8cf4d"
    ],
    "inputTokensBpe": 22962,
    "evidencePosition": "front"
  },
  {
    "questionId": "db72a78a7102b5f0e75a4d9e1a06a3c2e7aabb21",
    "paperId": "2002.01207",
    "question": "what are the previous state of the art?",
    "inputSha256": "9caa961ae1679f698cf5bbbc1da744532b7e477fe540bef2ebc2caa8439d70a9",
    "evidenceSetSha256": [
      "55ca7dfd6df87a761c882f0bc0ba018639c2cdf80fe55861412e1de1123e1f5d",
      "949583511530a998ed19e56364a83be76bd947af76a0ab8d61ea47111b5cedfe"
    ],
    "inputTokensBpe": 7464,
    "evidencePosition": "front"
  },
  {
    "questionId": "bc730e4d964b6a66656078e2da130310142ab641",
    "paperId": "1912.00667",
    "question": "What type of classifiers are used?",
    "inputSha256": "8878b9ca3f107ff51659920b66ed895d4c5b623f8769c8c458cfff10c9caa156",
    "evidenceSetSha256": [
      "bc974cad6e4457d4fbb16391734bddd7fe64042c61b075583d12aa832938c0b4",
      "230308afcda468afdf7095961fbcddb1ea6d21badea6fa5bd28fd4361ab13de6"
    ],
    "inputTokensBpe": 7173,
    "evidencePosition": "middle"
  },
  {
    "questionId": "d571e0b0f402a3d36fb30d70cdcd2911df883bc7",
    "paperId": "2002.07306",
    "question": "Is the system tested on low-resource languages?",
    "inputSha256": "631e3fe10c0ee4bf687be8a4ccdbac0c5b4e8a517a9a571ea6c08363508f56ad",
    "evidenceSetSha256": [
      "d570e82db6eb747509f2ff043ad62533d9b775f0c1fe8442ea4a77dea816beb0",
      "0dc191e70a78ea818e86ffb92b67c87d1cce6d39e77917e3c596a8deb317af14"
    ],
    "inputTokensBpe": 5632,
    "evidencePosition": "middle"
  },
  {
    "questionId": "15e481e668114e4afe0c78eefb716ffe1646b494",
    "paperId": "1908.09246",
    "question": "What alternative to Gibbs sampling is used?",
    "inputSha256": "d689a252b518eee19de74d7dfac9032c99d43e9c5e5c9937d7e19bf189ac788f",
    "evidenceSetSha256": [
      "91f52a08130374fb48108e7b696d144910975c2d36f0cd6144f6184f08242f9a"
    ],
    "inputTokensBpe": 5769,
    "evidencePosition": "front"
  },
  {
    "questionId": "2df4a045a9cd7b44874340b6fdf9308d3c55327a",
    "paperId": "1801.05147",
    "question": "What crowdsourcing platform is used?",
    "inputSha256": "0737bb8595a8b50a955c203d3acbd745eb8a8b40829e0bbafb7ff79190dac9e8",
    "evidenceSetSha256": [
      "b03faa3a2ab95f07d621178f66e5fff62a976e0347b9864c1cc3ef4672f54e5d"
    ],
    "inputTokensBpe": 8941,
    "evidencePosition": "back"
  },
  {
    "questionId": "1269c5d8f61e821ee0029080c5ba2500421d5fa6",
    "paperId": "1805.07133",
    "question": "what methods were used to reduce data sparsity effects?",
    "inputSha256": "9646131565ab10fe8bca647db426cf0093c7f2399063394ce9931fdcdcf7bcc1",
    "evidenceSetSha256": [
      "b452304794da49997ef81ef75bd919a7734318450f28513ffb1f6ec31c204e1e",
      "cdb00a995fa6b94d055ab9432c9ca30f9a2d08834d684f16918ebf82ed87a1a0"
    ],
    "inputTokensBpe": 5747,
    "evidencePosition": "middle"
  }
]
