Pipelines
Übersicht aller 13 Data-Platform-Pipelines — Sprachtechnologie, Bereinigung/Transformation und Datensatzverwaltung.
Der Data-Platform-Pipeline-Katalog umfasst drei Arten von Pipelines, alle über eine einheitliche API-Oberfläche aufrufbar (GET /v2/data-platform/pipelines/catalog, POST /v2/data-platform/pipelines/:slug/run):
- Sprachtechnologie (7 Pipelines) — extrahieren oder transformieren Inhalte und liefern Transkripte, Übersetzungen, erkannte Sprachen, Named Entities oder extrahierten Text als strukturiertes JSON. Im Gegensatz zu Verifikationspipelines liefern sie kein Echtheitsverdikt.
- Bereinigung & Transformation (3 Pipelines) —
clean-audio-silence,convert-format,pii-redact-text. Jede verarbeitet alle Dateien einer Datensatzversion und erzeugt eine neue abgeleitete Version. - Datensatzverwaltung (2 Pipelines) —
dedup-content-hash(markiert Duplikate direkt an Ort und Stelle, keine neue Version) undsplit-dataset-version(teilt eine Version in Train/Val/Test auf, synchron, keine Warteschlange).crowd-label-classifywird unten separat behandelt, da es einen Crowd-Job statt einer direkten Dateiverarbeitung erzeugt.
Sprachtechnologie-Pipelines
Jede LT-Pipeline verarbeitet eine Datei gleichzeitig. Ergebnisse werden als strukturiertes JSON im Run-Datensatz gespeichert und können über die API abgerufen oder direkt in der Plattform angezeigt werden.
| Pipeline | Slug | Modalität | Kosten | Geschätzte Zeit | Pflichtkontext |
|---|---|---|---|---|---|
| Audio-Transkription | lt-transcription | Audio, Video | 250 Credits | ~3 Min. | — |
| Textübersetzung | lt-translation | Text | 200 Credits | ~2 Min. | target_language |
| OCR — Bilder & PDFs | lt-ocr | Bild, Dokument | 200 Credits | ~3 Min. | — |
| Spracherkennung — Text | lt-language-id-text | Text | 100 Credits | ~1 Min. | — |
| Spracherkennung — Audio | lt-language-id-audio | Audio | 200 Credits | ~2 Min. | — |
| Entity-Erkennung — Text | lt-entity-detection-text | Text | 150 Credits | ~2 Min. | — |
| Entity-Erkennung — Audio | lt-entity-detection-audio | Audio | 350 Credits | ~5 Min. | — |
Bereinigungs-, Transformations- und Datensatzverwaltungs-Pipelines
Diese Pipelines laufen ausschließlich gegen eine Datensatzversion (targetType: "dataset_version") — nie gegen eine Ad-hoc-Auswahl von Projektdateien.
| Pipeline | Slug | Modalität | Kosten | Geschätzte Zeit | Pflichtkontext | Effekt |
|---|---|---|---|---|---|---|
| Audio-Stille-Trimming | clean-audio-silence | Audio | Kostenlos | ~2 Min. | — | Neue abgeleitete Version |
| Formatkonvertierung | convert-format | Audio | Kostenlos | ~2 Min. | targetFormat (mp3/wav/ogg/flac/m4a) | Neue abgeleitete Version |
| PII-Schwärzung — Text | pii-redact-text | Text | 50 Credits/Datei | ~2 Min. | — (optional piiTypes, redactionStyle) | Neue abgeleitete Version |
| Content-Hash-Deduplizierung | dedup-content-hash | Beliebig | Kostenlos | ~2 Min. | — | Markiert Duplikate direkt, keine neue Version |
| Train/Val/Test-Aufteilung | split-dataset-version | Beliebig | Kostenlos | Sofort | — (optional trainRatio/valRatio/testRatio/seed) | 3 neue Geschwisterversionen |
| Crowd-gestütztes Labeling | crowd-label-classify | Beliebig | 40 Credits/Antwort | ~60 Min. | labelTaxonomy, projectId (im Request-Body) | Erzeugt einen Crowd-Job; siehe unten |
Deduplizierungs-Review: dedup-content-hash löscht nie automatisch etwas. Prüfen Sie markierte Duplikatgruppen im Run-Ergebnis und schließen Sie eine Datei anschließend bei Bedarf mit PATCH /v2/datasets/:datasetId/versions/:versionId/files/:fileId { "excluded": true } aus der Version aus (reversibel — mit false wieder einschließen).
Crowd-gestütztes Labeling: crowd-label-classify erstellt ein input_data_sets/input_data_lists-Paar (eine Task-Variante pro Datei), eine Umfragevorlage und einen Crowd-Job — ein Label pro Datei, mit unabhängigem Mehrheitsentscheid pro Datei, sobald minResponsesPerFile (Standard 3) Worker für diese Datei geantwortet haben. Da Crowd-Jobs projektgebunden sind, muss der Request-Body eine projectId enthalten. Siehe Crowdsourcing-Jobs für die Funktionsweise der zugrunde liegenden Job-/Task-/Antwort-Laufzeitumgebung.
Pipeline auslösen
Sie können eine Pipeline über die Plattform-UI oder die API starten.
Über die Plattform
Öffnen Sie eine Datensatzversion (bei Sprachtechnologie-Pipelines auch den Files-Tab eines Projekts), wählen Sie eine Pipeline aus, markieren Sie ggf. die zu verarbeitenden Dateien, füllen Sie Pflichtfelder aus und klicken Sie auf Ausführen.
Über die API
Einheitlicher Endpunkt (empfohlen) — funktioniert für jede Pipeline im Katalog:
POST /v2/data-platform/pipelines/{slug}/run{
"targetType": "dataset_version",
"datasetId": "dataset_abc123",
"versionId": "version_def456",
"contextData": { "target_language": "Deutsch" }
}Oder gegen eine Ad-hoc-Auswahl von Projektdateien (nur Sprachtechnologie-Pipelines):
{
"targetType": "project_file",
"projectId": "project_abc123",
"fileIds": ["file_abc123"],
"contextData": {}
}Die Antwort ist { "runId": "...", "fileCount": N } — zusätzlich trainVersionId/valVersionId/testVersionId bei split-dataset-version, oder crowdJobId bei crowd-label-classify.
Legacy-Endpunkte (nur Sprachtechnologie-Pipelines, weiterhin als veraltete Aliase funktionsfähig):
POST /v2/lt-pipelines/project/{projectId}/run
POST /v2/lt-pipelines/dataset/{datasetId}/versions/{versionId}/runBeide geben ein runIds-Array zurück — eine ID pro Datei — statt der einzelnen runId des einheitlichen Endpunkts pro Aufruf.
Ergebnisse abrufen
Einzelnen Run über den einheitlichen Endpunkt abrufen:
GET /v2/data-platform/pipelines/runs/{runId}Runs auflisten, gefiltert nach Projekt, Datensatzversion oder Status:
GET /v2/data-platform/pipelines/runs?datasetVersionId={versionId}&status=completedEin Run enthält seine Datei- und Stufen-Aufschlüsselung (stageRuns). Die Legacy-Endpunkte GET /v2/lt-pipelines/runs/{runId} und GET /v2/lt-pipelines/project/{projectId}/runs bleiben für über die Legacy-Routen ausgelöste Sprachtechnologie-Pipelines verfügbar.
Sprachtechnologie-Pipeline-Seiten
Audio-Transkription
Audio- und Videodateien mit Whisper in Text mit Zeitstempeln auf Segmentebene transkribieren.
Textübersetzung
Textdateien mit einem LLM in eine beliebige Zielsprache übersetzen.
OCR — Bilder & PDFs
Text aus Bildern und PDFs extrahieren. Nutzt pdftotext für digitale PDFs und ein Vision-Modell für gescannte Dokumente.
Spracherkennung
Sprachen in Textdateien oder gesprochenen Audiodateien erkennen.
Entity-Erkennung
Named Entities — Personen, Organisationen, Orte, Daten, Ereignisse — aus Text oder Audio extrahieren.
Wie hilfreich ist diese Seite?
Datensätze
Versionierte Sammlungen von Mediendateien zum Trainieren und Testen von Verifizierungs-Pipelines.
Audio-Transkription
Audio- und Videodateien mit Whisper in Text mit Zeitstempeln auf Segmentebene transkribieren.