Skip to content
Merged
2 changes: 1 addition & 1 deletion pyproject.toml
Original file line number Diff line number Diff line change
Expand Up @@ -4,7 +4,7 @@ build-backend = "setuptools.build_meta"

[project]
name = "gasbench"
version = "0.9.3"
version = "0.9.4"
description = "GASBench - ML model benchmark evaluation package"
readme = "README.md"
requires-python = ">=3.10"
Expand Down
2 changes: 1 addition & 1 deletion src/gasbench/dataset/config.py
Original file line number Diff line number Diff line change
Expand Up @@ -25,7 +25,7 @@
BENCHMARK_TOTAL_OVERRIDES = {
"debug": {"image": 100, "video": 50, "audio": 50},
"small": {"image": 5000, "video": 5000, "audio": 5000},
"full": {"image": 69000, "video": 33000, "audio": 47000},
"full": {"image": 72500, "video": 34000, "audio": 47500},
}

# Per-dataset download limits (only applied in debug/small modes for faster testing)
Expand Down
54 changes: 54 additions & 0 deletions src/gasbench/dataset/configs/real_audio.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -755,3 +755,57 @@ datasets:
generator_family: real
content_category: speech
notes: CML-TTS Spanish train split, released from v22 bmcore holdouts

# ── Released v23 holdouts — deferred to upstream repos (no 34data mirror) ──

- name: cml-tts-dutch
path: ylacombe/cml-tts
hf_revision: 48aedd7a8ea08efc75cae3e81fbefa9720df0812
modality: audio
media_type: real
source_format: parquet
media_per_archive: 500
archives_per_dataset: 2
hf_subfolders: ['dutch']
include_paths: ['train-']
generator_family: real
content_category: speech

- name: cml-tts-italian
path: ylacombe/cml-tts
hf_revision: 48aedd7a8ea08efc75cae3e81fbefa9720df0812
modality: audio
media_type: real
source_format: parquet
media_per_archive: 500
archives_per_dataset: 2
hf_subfolders: ['italian']
include_paths: ['train-']
generator_family: real
content_category: speech

- name: cml-tts-polish
path: ylacombe/cml-tts
hf_revision: 48aedd7a8ea08efc75cae3e81fbefa9720df0812
modality: audio
media_type: real
source_format: parquet
media_per_archive: 500
archives_per_dataset: 2
hf_subfolders: ['polish']
include_paths: ['train-']
generator_family: real
content_category: speech

- name: cml-tts-portuguese
path: ylacombe/cml-tts
hf_revision: 48aedd7a8ea08efc75cae3e81fbefa9720df0812
modality: audio
media_type: real
source_format: parquet
media_per_archive: 500
archives_per_dataset: 2
hf_subfolders: ['portuguese']
include_paths: ['train-']
generator_family: real
content_category: speech
99 changes: 99 additions & 0 deletions src/gasbench/dataset/configs/real_images.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -1151,3 +1151,102 @@ datasets:
generator_family: real
content_category: documents
notes: Released from v22 bmcore holdouts

# ── Released v23 holdouts ─────────────────────────────────────────────────

- name: kidney-stone-ct
path: 34data/kidney-stone-ct
modality: image
media_type: real
source_format: parquet
media_per_archive: 1000
archives_per_dataset: 1
generator_family: real
content_category: medical

- name: malaria-bounding-boxes
path: 34data/malaria-bounding-boxes
modality: image
media_type: real
source_format: parquet
media_per_archive: 1000
archives_per_dataset: 1
generator_family: real
content_category: medical

- name: pulmonary-chest-xray-abnormalities
path: 34data/pulmonary-chest-xray-abnormalities
modality: image
media_type: real
source_format: parquet
media_per_archive: 1000
archives_per_dataset: 1
generator_family: real
content_category: medical

- name: dermnet
path: 34data/dermnet
modality: image
media_type: real
source_format: parquet
media_per_archive: 1000
archives_per_dataset: 1
generator_family: real
content_category: medical

- name: coronahack-chest-xray
path: 34data/coronahack-chest-xray
modality: image
media_type: real
source_format: parquet
media_per_archive: 1000
archives_per_dataset: 1
generator_family: real
content_category: medical

- name: lits-256
path: 34data/lits-256
modality: image
media_type: real
source_format: parquet
media_per_archive: 1000
archives_per_dataset: 1
generator_family: real
content_category: medical

- name: tcga-coad-msi-mss
path: 34data/tcga-coad-msi-mss
modality: image
media_type: real
source_format: parquet
media_per_archive: 1000
archives_per_dataset: 1
generator_family: real
content_category: medical

# ── Released v23 holdouts — deferred to upstream repos (no 34data mirror) ──

- name: conceptual-captions-0-1m
path: obscure-entropy/conceptual_captions_hu_filtered
hf_revision: e70871e77287ca4aec4a12ff2f9cec32cad5694a
modality: image
media_type: real
source_format: parquet
data_columns: [img]
media_per_archive: 1000
archives_per_dataset: 1
include_paths: ['data/conceptual_captions_0_1m.parquet']
generator_family: real
content_category: diverse

- name: rocov2-radiology
path: eltorio/ROCOv2-radiology
hf_revision: 80ffeef4eb8d34d27cb5c2815305f1d8aee8a83c
modality: image
media_type: real
source_format: parquet
media_per_archive: 1000
archives_per_dataset: 1
include_paths: ['data/train-']
generator_family: real
content_category: medical
62 changes: 62 additions & 0 deletions src/gasbench/dataset/configs/real_videos.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -1093,3 +1093,65 @@ datasets:
generator_family: real
content_category: action
notes: Released from v22 bmcore holdouts

# ── Released v23 holdouts — deferred to upstream repos (no 34data mirror) ──

- name: timelens2-93k-00003
path: MCG-NJU/TimeLens2-93K
hf_revision: fce4049cdf5d720e2651b956c58e664c3386c021
modality: video
media_type: real
source_format: tar
media_per_archive: 500
archives_per_dataset: 1
include_paths: ['videos/videos-00003-of-00018.tar']
generator_family: real
content_category: diverse

- name: llava-onevision-2-mid-training-00000
path: mvp-lab/LLaVA-OneVision-2-Data
hf_revision: bf7038ba5d17771dc113a3072f98591ad2e29541
modality: video
media_type: real
source_format: tar
media_per_archive: 500
archives_per_dataset: 1
include_paths: ['mid_training_video/30s/train_00000_of_09707.tar']
generator_family: real
content_category: diverse

- name: rekadaily-phone-shard-00000
path: RekaAI/RekaDaily-10k-raw
hf_revision: a42e2da9aaeef7c8653d9de50772c97ceb954251
modality: video
media_type: real
source_format: tar
media_per_archive: 500
archives_per_dataset: 1
include_paths: ['data/video_capture_first_person_videos_phone/shard-00000.tar']
generator_family: real
content_category: action

- name: rekadaily-phone-shard-00001
path: RekaAI/RekaDaily-10k-raw
hf_revision: a42e2da9aaeef7c8653d9de50772c97ceb954251
modality: video
media_type: real
source_format: tar
media_per_archive: 500
archives_per_dataset: 1
include_paths: ['data/video_capture_first_person_videos_phone/shard-00001.tar']
generator_family: real
content_category: action

- name: rekadaily-phone-shard-00002
path: RekaAI/RekaDaily-10k-raw
hf_revision: a42e2da9aaeef7c8653d9de50772c97ceb954251
modality: video
media_type: real
source_format: tar
media_per_archive: 500
archives_per_dataset: 1
include_paths: ['data/video_capture_first_person_videos_phone/shard-00002.tar']
generator_family: real
content_category: action
64 changes: 64 additions & 0 deletions src/gasbench/dataset/configs/synthetic_audio.yaml
Original file line number Diff line number Diff line change
Expand Up @@ -796,3 +796,67 @@ datasets:
generator_family: mixed-generation
content_category: speech
notes: Synthetic subset of the official RuASD anti-spoofing dataset

# ── Released v23 holdouts ─────────────────────────────────────────────────

- name: indic-tts-urdu
path: 34data/indic-tts-urdu
modality: audio
media_type: synthetic
source_format: zip
media_per_archive: 500
archives_per_dataset: 2
generator_family: mixed-generation
content_category: speech

- name: ai4bharat-speecharenabench-gu
path: ai4bharat/SpeechArenaBench
modality: audio
media_type: synthetic
source_format: parquet
media_per_archive: 500
archives_per_dataset: 2
hf_revision: fdd26e85ff051036e3eb49d7053d2b8f15c14ec0
hf_subfolders: [gu]
data_columns: [audio_a]
generator_family: mixed-generation
content_category: speech

- name: ai4bharat-speecharenabench-ml
path: ai4bharat/SpeechArenaBench
modality: audio
media_type: synthetic
source_format: parquet
media_per_archive: 500
archives_per_dataset: 2
hf_revision: fdd26e85ff051036e3eb49d7053d2b8f15c14ec0
hf_subfolders: [ml]
data_columns: [audio_a]
generator_family: mixed-generation
content_category: speech

- name: ai4bharat-speecharenabench-or
path: ai4bharat/SpeechArenaBench
modality: audio
media_type: synthetic
source_format: parquet
media_per_archive: 500
archives_per_dataset: 2
hf_revision: fdd26e85ff051036e3eb49d7053d2b8f15c14ec0
hf_subfolders: [or]
data_columns: [audio_a]
generator_family: mixed-generation
content_category: speech

- name: ai4bharat-speecharenabench-ur
path: ai4bharat/SpeechArenaBench
modality: audio
media_type: synthetic
source_format: parquet
media_per_archive: 500
archives_per_dataset: 2
hf_revision: fdd26e85ff051036e3eb49d7053d2b8f15c14ec0
hf_subfolders: [ur]
data_columns: [audio_a]
generator_family: mixed-generation
content_category: speech
Loading
Loading