Skip to content

Persist pairs to save large overhead when training model on large datasets - #304

Merged
florian-huber merged 6 commits into
mainfrom
persist_pairs
Sep 8, 2026
Merged

Persist pairs to save large overhead when training model on large datasets#304
florian-huber merged 6 commits into
mainfrom
persist_pairs

Conversation

@florian-huber

@florian-huber florian-huber commented Sep 7, 2026

Copy link
Copy Markdown
Member

For larger datasets (say millions of spectra or > 100,000 compounds) the bias-compensating pair search is quite compute intensive. There would still be room for some more runtime optimization, but that will be a lot of additional work. So, for now, this PR will add one big helping step if it comes to repeated trainings on the same dataset/split, for instance for parameter searches etc.
--> The selected pairs/splits can now be stored in a dedicated folder pair_data_folder and will be reused when possible.

@sonarqubecloud

sonarqubecloud Bot commented Sep 7, 2026

Copy link
Copy Markdown

Quality Gate Failed Quality Gate failed

Failed conditions
78.4% Coverage on New Code (required ≥ 80%)

See analysis details on SonarQube Cloud

@florian-huber
florian-huber merged commit 4ea7cc9 into main Sep 8, 2026
14 checks passed
@florian-huber
florian-huber deleted the persist_pairs branch September 8, 2026 11:54
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant