DataForgeAdaptive dataset repair loop
Idle
// DataForgeLive repair loop

Stop training on broken data.

DataForge evaluates an image dataset, explains coverage gaps, generates targeted synthetic samples, and proves the improvement with a second quality pass.

Realtime cockpit

Closed-loop repair pipeline

Quality score--Waiting for baseline
Balance score--Measured by demo-adaption
Coverage score--Low-light and wildlife gaps
Synthetic samples0Fal fallback records
Canonical pipeline

Label · Deduplicate · Balance · Re-evaluate · Export

Label audit

Approve missing labels and relabel likely mistakes before moving to dedupe.

Missing labels

0

Suspected wrong labels

0

Accepted completions

0

Accepted corrections

0

Rejected suggestions

0

Remaining review

0
0 issues waitingConfidence is an internal heuristic for demo review.

No open label issues at this stage.

Duplicate review

Review suspected duplicates before export. This removes duplicate export entries, not source image files.

Suspected

0

Removed

0

Kept

0

Manual review

0

No duplicate issues detected yet.

Balancing plan

Class weight & sampling recommendations

These are recommendations, not new images. Class weights apply at training time. Synthetic generation is opt-in and flagged in the export manifest.

The balancing plan appears once labelization completes.
Quality report

Measured gaps, inferred fixes

Every metric is labeled with its source. The GPT evaluator scores the manifest — it does not inspect image pixels. Visual findings come from seeded demo truth or a vision-capable model elsewhere in the pipeline.

Balance0Completeness0
MeasuredGPT evaluator (adaption)

Quality snapshots

BaselineOriginal
  • QualityGPT
  • BalanceGPT
  • CompletenessGPT
  • ConsistencyGPT
FinalAfter repair
  • QualityGPT
  • BalanceGPT
  • CompletenessGPT
  • ConsistencyGPT
  • Samples0Local
  • Classes0Local
  • Missing labels0Local
  • Suspected mislabels0Vision
  • Duplicates0Local
  • Newly labeled0Vision
  • Corrected0Vision
InferredSource: demo-openai · idle

repair plan

No dataset loaded. Drop a ZIP to begin.

Dataset explorer

0 samples · 0 label issues · 0 duplicate issues

SampleSourceOriginalCurrentFinalReasonProvenanceStatus
No samples match this filter.
Export

Clean labeled dataset manifest

JSON manifest with full provenance: original labels, final labels, label decisions, duplicate decisions, balancing recommendations, provider boundary notes, and both Adaption evaluation snapshots.

Samples included
0
Removed (dupes)
0
Label issues
0
Balancing entries
0
Quality (baseline → final)
Quality report

Measured gaps, inferred fixes

Measured

Adaption evaluation snapshot

  • Drop a ZIP to begin.
Inferred

GPT repair plan

  • Drop a ZIP to begin.
Before / afterClass distribution
Source Augmented
Before / afterClass distribution
  • Source
  • Final
Load a dataset to populate distribution.
Dataset explorer

Inspect sample provenance

SampleClassSourceScenarioStatus
Load the demo dataset to inspect records.