diff --git a/src/gasbench/dataset/config.py b/src/gasbench/dataset/config.py index a814e2d..5c5c2b3 100644 --- a/src/gasbench/dataset/config.py +++ b/src/gasbench/dataset/config.py @@ -25,7 +25,7 @@ BENCHMARK_TOTAL_OVERRIDES = { "debug": {"image": 100, "video": 50, "audio": 50}, "small": {"image": 5000, "video": 5000, "audio": 5000}, - "full": {"image": 69000, "video": 33000, "audio": 47000}, + "full": {"image": 72500, "video": 34000, "audio": 47500}, } # Per-dataset download limits (only applied in debug/small modes for faster testing) diff --git a/src/gasbench/dataset/configs/real_images.yaml b/src/gasbench/dataset/configs/real_images.yaml index 3a9afac..39f68f3 100644 --- a/src/gasbench/dataset/configs/real_images.yaml +++ b/src/gasbench/dataset/configs/real_images.yaml @@ -1151,3 +1151,75 @@ datasets: generator_family: real content_category: documents notes: Released from v22 bmcore holdouts + + # ── Released v23 holdouts ───────────────────────────────────────────────── + + - name: kidney-stone-ct + path: 34data/kidney-stone-ct + modality: image + media_type: real + source_format: parquet + media_per_archive: 1000 + archives_per_dataset: 1 + generator_family: real + content_category: medical + + - name: malaria-bounding-boxes + path: 34data/malaria-bounding-boxes + modality: image + media_type: real + source_format: parquet + media_per_archive: 1000 + archives_per_dataset: 1 + generator_family: real + content_category: medical + + - name: pulmonary-chest-xray-abnormalities + path: 34data/pulmonary-chest-xray-abnormalities + modality: image + media_type: real + source_format: parquet + media_per_archive: 1000 + archives_per_dataset: 1 + generator_family: real + content_category: medical + + - name: dermnet + path: 34data/dermnet + modality: image + media_type: real + source_format: parquet + media_per_archive: 1000 + archives_per_dataset: 1 + generator_family: real + content_category: medical + + - name: coronahack-chest-xray + path: 34data/coronahack-chest-xray + modality: image + media_type: real + source_format: parquet + media_per_archive: 1000 + archives_per_dataset: 1 + generator_family: real + content_category: medical + + - name: lits-256 + path: 34data/lits-256 + modality: image + media_type: real + source_format: parquet + media_per_archive: 1000 + archives_per_dataset: 1 + generator_family: real + content_category: medical + + - name: tcga-coad-msi-mss + path: 34data/tcga-coad-msi-mss + modality: image + media_type: real + source_format: parquet + media_per_archive: 1000 + archives_per_dataset: 1 + generator_family: real + content_category: medical diff --git a/src/gasbench/dataset/configs/synthetic_audio.yaml b/src/gasbench/dataset/configs/synthetic_audio.yaml index c285ba2..da74040 100644 --- a/src/gasbench/dataset/configs/synthetic_audio.yaml +++ b/src/gasbench/dataset/configs/synthetic_audio.yaml @@ -796,3 +796,15 @@ datasets: generator_family: mixed-generation content_category: speech notes: Synthetic subset of the official RuASD anti-spoofing dataset + + # ── Released v23 holdouts ───────────────────────────────────────────────── + + - name: indic-tts-urdu + path: 34data/indic-tts-urdu + modality: audio + media_type: synthetic + source_format: zip + media_per_archive: 500 + archives_per_dataset: 2 + generator_family: mixed-generation + content_category: speech diff --git a/src/gasbench/dataset/configs/synthetic_images.yaml b/src/gasbench/dataset/configs/synthetic_images.yaml index a031471..ef12539 100644 --- a/src/gasbench/dataset/configs/synthetic_images.yaml +++ b/src/gasbench/dataset/configs/synthetic_images.yaml @@ -942,3 +942,35 @@ datasets: notes: PICA-100K is purely synthetic (PICABench; video-derived src and edited tgt). Not split — src is not camera-real. generator_family: mixed-generation content_category: diverse + + # ── Released v23 holdouts ───────────────────────────────────────────────── + + - name: synthetic-human + path: 34data/synthetic-human + modality: image + media_type: synthetic + source_format: parquet + media_per_archive: 1000 + archives_per_dataset: 1 + generator_family: mixed-generation + content_category: faces + + - name: ai-generated-ecommerce-damaged-product + path: 34data/ai-generated-ecommerce-damaged-product + modality: image + media_type: synthetic + source_format: parquet + media_per_archive: 1000 + archives_per_dataset: 1 + generator_family: mixed-generation + content_category: diverse + + - name: ai-generated-ecommerce-fake-logistics + path: 34data/ai-generated-ecommerce-fake-logistics + modality: image + media_type: synthetic + source_format: parquet + media_per_archive: 1000 + archives_per_dataset: 1 + generator_family: mixed-generation + content_category: diverse diff --git a/src/gasbench/dataset/configs/synthetic_videos.yaml b/src/gasbench/dataset/configs/synthetic_videos.yaml index 7ed8cb6..eb997b8 100644 --- a/src/gasbench/dataset/configs/synthetic_videos.yaml +++ b/src/gasbench/dataset/configs/synthetic_videos.yaml @@ -1266,3 +1266,75 @@ datasets: generator_family: mixed-generation content_category: diverse notes: Released from v22 bmcore holdouts + + # ── Released v23 holdouts ───────────────────────────────────────────────── + + - name: videogen-rewardbench-easyanimatev4 + path: 34data/videogen-rewardbench-easyanimatev4 + modality: video + media_type: synthetic + source_format: mp4 + media_per_archive: 500 + archives_per_dataset: 1 + generator_family: easyanimate + content_category: diverse + + - name: videogen-rewardbench-opensora1-2 + path: 34data/videogen-rewardbench-opensora1-2 + modality: video + media_type: synthetic + source_format: mp4 + media_per_archive: 500 + archives_per_dataset: 1 + generator_family: opensora + content_category: diverse + + - name: videogen-rewardbench-qingying + path: 34data/videogen-rewardbench-qingying + modality: video + media_type: synthetic + source_format: mp4 + media_per_archive: 500 + archives_per_dataset: 1 + generator_family: qingying + content_category: diverse + + - name: videogen-rewardbench-tongyi + path: 34data/videogen-rewardbench-tongyi + modality: video + media_type: synthetic + source_format: mp4 + media_per_archive: 500 + archives_per_dataset: 1 + generator_family: tongyi + content_category: diverse + + - name: videogen-rewardbench-vidu + path: 34data/videogen-rewardbench-vidu + modality: video + media_type: synthetic + source_format: mp4 + media_per_archive: 500 + archives_per_dataset: 1 + generator_family: vidu + content_category: diverse + + - name: edtalk + path: 34data/edtalk + modality: video + media_type: semisynthetic + source_format: mp4 + media_per_archive: 500 + archives_per_dataset: 1 + generator_family: edtalk + content_category: faces + + - name: float-talking-head + path: 34data/float-talking-head + modality: video + media_type: semisynthetic + source_format: mp4 + media_per_archive: 500 + archives_per_dataset: 1 + generator_family: float + content_category: faces