Crowdee
Pipelines

Pipelines

Übersicht aller 13 Data-Platform-Pipelines — Sprachtechnologie, Bereinigung/Transformation und Datensatzverwaltung.

Der Data-Platform-Pipeline-Katalog umfasst drei Arten von Pipelines, alle über eine einheitliche API-Oberfläche aufrufbar (GET /v2/data-platform/pipelines/catalog, POST /v2/data-platform/pipelines/:slug/run):

  • Sprachtechnologie (7 Pipelines) — extrahieren oder transformieren Inhalte und liefern Transkripte, Übersetzungen, erkannte Sprachen, Named Entities oder extrahierten Text als strukturiertes JSON. Im Gegensatz zu Verifikationspipelines liefern sie kein Echtheitsverdikt.
  • Bereinigung & Transformation (3 Pipelines)clean-audio-silence, convert-format, pii-redact-text. Jede verarbeitet alle Dateien einer Datensatzversion und erzeugt eine neue abgeleitete Version.
  • Datensatzverwaltung (2 Pipelines)dedup-content-hash (markiert Duplikate direkt an Ort und Stelle, keine neue Version) und split-dataset-version (teilt eine Version in Train/Val/Test auf, synchron, keine Warteschlange). crowd-label-classify wird unten separat behandelt, da es einen Crowd-Job statt einer direkten Dateiverarbeitung erzeugt.

Sprachtechnologie-Pipelines

Jede LT-Pipeline verarbeitet eine Datei gleichzeitig. Ergebnisse werden als strukturiertes JSON im Run-Datensatz gespeichert und können über die API abgerufen oder direkt in der Plattform angezeigt werden.

PipelineSlugModalitätKostenGeschätzte ZeitPflichtkontext
Audio-Transkriptionlt-transcriptionAudio, Video250 Credits~3 Min.
Textübersetzunglt-translationText200 Credits~2 Min.target_language
OCR — Bilder & PDFslt-ocrBild, Dokument200 Credits~3 Min.
Spracherkennung — Textlt-language-id-textText100 Credits~1 Min.
Spracherkennung — Audiolt-language-id-audioAudio200 Credits~2 Min.
Entity-Erkennung — Textlt-entity-detection-textText150 Credits~2 Min.
Entity-Erkennung — Audiolt-entity-detection-audioAudio350 Credits~5 Min.

Bereinigungs-, Transformations- und Datensatzverwaltungs-Pipelines

Diese Pipelines laufen ausschließlich gegen eine Datensatzversion (targetType: "dataset_version") — nie gegen eine Ad-hoc-Auswahl von Projektdateien.

PipelineSlugModalitätKostenGeschätzte ZeitPflichtkontextEffekt
Audio-Stille-Trimmingclean-audio-silenceAudioKostenlos~2 Min.Neue abgeleitete Version
Formatkonvertierungconvert-formatAudioKostenlos~2 Min.targetFormat (mp3/wav/ogg/flac/m4a)Neue abgeleitete Version
PII-Schwärzung — Textpii-redact-textText50 Credits/Datei~2 Min.— (optional piiTypes, redactionStyle)Neue abgeleitete Version
Content-Hash-Deduplizierungdedup-content-hashBeliebigKostenlos~2 Min.Markiert Duplikate direkt, keine neue Version
Train/Val/Test-Aufteilungsplit-dataset-versionBeliebigKostenlosSofort— (optional trainRatio/valRatio/testRatio/seed)3 neue Geschwisterversionen
Crowd-gestütztes Labelingcrowd-label-classifyBeliebig40 Credits/Antwort~60 Min.labelTaxonomy, projectId (im Request-Body)Erzeugt einen Crowd-Job; siehe unten

Deduplizierungs-Review: dedup-content-hash löscht nie automatisch etwas. Prüfen Sie markierte Duplikatgruppen im Run-Ergebnis und schließen Sie eine Datei anschließend bei Bedarf mit PATCH /v2/datasets/:datasetId/versions/:versionId/files/:fileId { "excluded": true } aus der Version aus (reversibel — mit false wieder einschließen).

Crowd-gestütztes Labeling: crowd-label-classify erstellt ein input_data_sets/input_data_lists-Paar (eine Task-Variante pro Datei), eine Umfragevorlage und einen Crowd-Job — ein Label pro Datei, mit unabhängigem Mehrheitsentscheid pro Datei, sobald minResponsesPerFile (Standard 3) Worker für diese Datei geantwortet haben. Da Crowd-Jobs projektgebunden sind, muss der Request-Body eine projectId enthalten. Siehe Crowdsourcing-Jobs für die Funktionsweise der zugrunde liegenden Job-/Task-/Antwort-Laufzeitumgebung.

Pipeline auslösen

Sie können eine Pipeline über die Plattform-UI oder die API starten.

Über die Plattform

Öffnen Sie eine Datensatzversion (bei Sprachtechnologie-Pipelines auch den Files-Tab eines Projekts), wählen Sie eine Pipeline aus, markieren Sie ggf. die zu verarbeitenden Dateien, füllen Sie Pflichtfelder aus und klicken Sie auf Ausführen.

Über die API

Einheitlicher Endpunkt (empfohlen) — funktioniert für jede Pipeline im Katalog:

POST /v2/data-platform/pipelines/{slug}/run
{
  "targetType": "dataset_version",
  "datasetId": "dataset_abc123",
  "versionId": "version_def456",
  "contextData": { "target_language": "Deutsch" }
}

Oder gegen eine Ad-hoc-Auswahl von Projektdateien (nur Sprachtechnologie-Pipelines):

{
  "targetType": "project_file",
  "projectId": "project_abc123",
  "fileIds": ["file_abc123"],
  "contextData": {}
}

Die Antwort ist { "runId": "...", "fileCount": N } — zusätzlich trainVersionId/valVersionId/testVersionId bei split-dataset-version, oder crowdJobId bei crowd-label-classify.

Legacy-Endpunkte (nur Sprachtechnologie-Pipelines, weiterhin als veraltete Aliase funktionsfähig):

POST /v2/lt-pipelines/project/{projectId}/run
POST /v2/lt-pipelines/dataset/{datasetId}/versions/{versionId}/run

Beide geben ein runIds-Array zurück — eine ID pro Datei — statt der einzelnen runId des einheitlichen Endpunkts pro Aufruf.

Ergebnisse abrufen

Einzelnen Run über den einheitlichen Endpunkt abrufen:

GET /v2/data-platform/pipelines/runs/{runId}

Runs auflisten, gefiltert nach Projekt, Datensatzversion oder Status:

GET /v2/data-platform/pipelines/runs?datasetVersionId={versionId}&status=completed

Ein Run enthält seine Datei- und Stufen-Aufschlüsselung (stageRuns). Die Legacy-Endpunkte GET /v2/lt-pipelines/runs/{runId} und GET /v2/lt-pipelines/project/{projectId}/runs bleiben für über die Legacy-Routen ausgelöste Sprachtechnologie-Pipelines verfügbar.

Sprachtechnologie-Pipeline-Seiten

Wie hilfreich ist diese Seite?

© 2026 Crowdee GmbH. Alle Rechte vorbehalten.

On this page