Jisu80609 commited on
Commit
fc41744
ยท
1 Parent(s): 803f1c4

Initial commit for the custom_summarization_dataset

Browse files
README.md ADDED
@@ -0,0 +1,37 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+
2
+ # Dataset Card for Custom Text Dataset
3
+
4
+ ## Dataset Name
5
+ ์ปค์Šคํ…€ CNN/DailyMail ์ถ”์ถœ ์š”์•ฝ ๋ฐ์ดํ„ฐ์…‹
6
+
7
+ ## Overview
8
+ ์ด ๋ฐ์ดํ„ฐ์…‹์€ CNN/DailyMail ๋‰ด์Šค ๊ธฐ์‚ฌ์—์„œ ์ถ”์ถœํ•œ ๋ฌธ์žฅ๋“ค๊ณผ ํ•ด๋‹น ๋ฌธ์žฅ์˜ ์š”์•ฝ์œผ๋กœ ๊ตฌ์„ฑ๋˜์–ด ์žˆ๋‹ค.
9
+ ์ด ๋ฐ์ดํ„ฐ์…‹์€ ํ›ˆ๋ จ ๋ฐ ํ…Œ์ŠคํŠธ๋ฅผ ์œ„ํ•ด ์ปค์Šคํ…€ํ•œ ์†Œ๊ทœ๋ชจ ํ•˜์œ„ ๋ฐ์ดํ„ฐ์…‹์„ ํฌํ•จํ•˜๊ณ  ์žˆ๋‹ค.
10
+
11
+ ## Composition
12
+ - ํ›ˆ๋ จ ๋ฐ์ดํ„ฐ: ํ•˜๋‚˜์˜ ๋ฌธ์žฅ๊ณผ ๊ทธ์— ๋Œ€ํ•œ ์š”์•ฝ์ด ํฌํ•จ๋œ ์ƒ˜ํ”Œ.
13
+ - ํ…Œ์ŠคํŠธ ๋ฐ์ดํ„ฐ: CNN/DailyMail ๋ฐ์ดํ„ฐ์…‹์˜ ์›๋ณธ ํ…Œ์ŠคํŠธ ์„ธํŠธ์—์„œ 100๊ฐœ์˜ ์ƒ˜ํ”Œ์„ ์ถ”์ถœ.
14
+
15
+ ## Collection Process
16
+ ํ›ˆ๋ จ ๋ฐ์ดํ„ฐ๋Š” ์ˆ˜์ž‘์—…์œผ๋กœ ์ƒ์„ฑ๋˜์—ˆ์œผ๋ฉฐ, ํ…Œ์ŠคํŠธ ๋ฐ์ดํ„ฐ๋Š” `cnn_dailymail` ๋ฐ์ดํ„ฐ์…‹์˜ ํ…Œ์ŠคํŠธ ์„ธํŠธ์—์„œ ์ถ”์ถœ๋˜์—ˆ๋‹ค.
17
+
18
+ ## Preprocessing
19
+ Hugging Face `datasets` ๋ผ์ด๋ธŒ๋Ÿฌ๋ฆฌ๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ๋ฐ์ดํ„ฐ๋ฅผ ์ „์ฒ˜๋ฆฌํ–ˆ๋‹ค. ํ›ˆ๋ จ ๋ฐ ํ…Œ์ŠคํŠธ ๋ฐ์ดํ„ฐ์…‹์€ Hugging Face์—์„œ ์‚ฌ์šฉํ•  ์ˆ˜ ์žˆ๋Š” ํ˜•์‹์œผ๋กœ ์ €์žฅ๋˜์—ˆ๋‹ค.
20
+
21
+ ## How to Use
22
+ ```python
23
+ from datasets import load_from_disk
24
+
25
+ train_dataset = load_from_disk('./results/custom_dataset/train')
26
+ test_dataset = load_from_disk('./results/custom_dataset/test')
27
+ ```
28
+
29
+ ## Evaluation
30
+ ์ด ๋ฐ์ดํ„ฐ์…‹์€ ROUGE์™€ ๊ฐ™์€ ์ „ํ†ต์ ์ธ ์š”์•ฝ ํ‰๊ฐ€ ์ง€ํ‘œ๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ํ‰๊ฐ€ํ•  ์ˆ˜ ์žˆ๋‹ค.
31
+
32
+ ## Limitations
33
+ ํ›ˆ๋ จ ๋ฐ์ดํ„ฐ์…‹์€ ๋งค์šฐ ์ ์€ ์–‘์œผ๋กœ, ์ผ๋ฐ˜ํ™”๊ฐ€ ์–ด๋ ค์šธ ์ˆ˜ ์žˆ๋‹ค. ํ…Œ์ŠคํŠธ ๋ฐ์ดํ„ฐ๋Š” ์™ธ๋ถ€ ์ถœ์ฒ˜์—์„œ ๊ฐ€์ ธ์™”์œผ๋ฉฐ, ์›๋ณธ ๋ฐ์ดํ„ฐ์…‹์— ์กด์žฌํ•˜๋Š” ํŽธํ–ฅ์ด ํฌํ•จ๋  ์ˆ˜ ์žˆ๋‹ค.
34
+
35
+ ## Ethical Considerations
36
+ ์ด ๋ฐ์ดํ„ฐ์…‹์—๋Š” ๋ฏผ๊ฐํ•œ ์ •์น˜์  ์ฃผ์ œ์™€ ๊ด€๋ จ๋œ ๋‚ด์šฉ์ด ํฌํ•จ๋˜์–ด ์žˆ๋‹ค. ์‚ฌ์šฉ์ž๋Š” ์š”์•ฝ์—์„œ ๋ฐœ์ƒํ•  ์ˆ˜ ์žˆ๋Š” ์˜คํ•ด๋‚˜ ํŽธํ–ฅ์„ ์ฃผ์˜ํ•ด์•ผ ํ•œ๋‹ค
37
+
test/dataset_dict.json ADDED
@@ -0,0 +1 @@
 
 
1
+ {"splits": ["test"]}
test/test/data-00000-of-00001.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1e6aa13a3e10a33624931f6c220c9618528323886bd7b7ac334af681b8dc0646
3
+ size 346576
test/test/dataset_info.json ADDED
@@ -0,0 +1,22 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "citation": "",
3
+ "description": "",
4
+ "features": {
5
+ "sentence": {
6
+ "feature": {
7
+ "dtype": "string",
8
+ "_type": "Value"
9
+ },
10
+ "_type": "Sequence"
11
+ },
12
+ "labels": {
13
+ "feature": {
14
+ "dtype": "string",
15
+ "_type": "Value"
16
+ },
17
+ "_type": "Sequence"
18
+ }
19
+ },
20
+ "homepage": "",
21
+ "license": ""
22
+ }
test/test/state.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_data_files": [
3
+ {
4
+ "filename": "data-00000-of-00001.arrow"
5
+ }
6
+ ],
7
+ "_fingerprint": "a966e5e39a3a551f",
8
+ "_format_columns": null,
9
+ "_format_kwargs": {},
10
+ "_format_type": null,
11
+ "_output_all_columns": false,
12
+ "_split": null
13
+ }
train/dataset_dict.json ADDED
@@ -0,0 +1 @@
 
 
1
+ {"splits": ["train"]}
train/train/data-00000-of-00001.arrow ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c3b84a293ed7afd9641f578c760558feab774e12174775ffef3bd6d130873903
3
+ size 1400
train/train/dataset_info.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "citation": "",
3
+ "description": "",
4
+ "features": {
5
+ "sentence": {
6
+ "dtype": "string",
7
+ "_type": "Value"
8
+ },
9
+ "labels": {
10
+ "dtype": "string",
11
+ "_type": "Value"
12
+ }
13
+ },
14
+ "homepage": "",
15
+ "license": ""
16
+ }
train/train/state.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_data_files": [
3
+ {
4
+ "filename": "data-00000-of-00001.arrow"
5
+ }
6
+ ],
7
+ "_fingerprint": "a1df46296853828f",
8
+ "_format_columns": null,
9
+ "_format_kwargs": {},
10
+ "_format_type": null,
11
+ "_output_all_columns": false,
12
+ "_split": null
13
+ }