Crowdee
Grundkonzepte

Trainingsdaten

Wie ein Finetuning-Datensatz aus einer Data-Platform-Datensatzversion oder den akzeptierten Antworten eines Crowd-Platform-Jobs zusammengestellt wird.

Jeder Finetuning-Lauf benötigt einen Finetune-Datensatz — ein Trainingspaare-Manifest, das aus einer von zwei Quellen aufgebaut wird. Die KI-Plattform sammelt selbst keine Labels — sie verwandelt Daten, die Sie bereits auf der Data Platform oder Crowd Platform haben, in einen einsatzbereiten Trainingsdatensatz.

Quelle 1: Eine Data-Platform-Datensatzversion

Wenn eine Datensatzversion bereits die Pipeline Crowd-unterstütztes Labeling (crowd-label-classify) durchlaufen hat, liest die KI-Plattform deren dateibezogene Labels (data_platform_file_labels, das Mehrheitsentscheid-Ergebnis des Crowd-Konsens dieser Pipeline) und ordnet jeder Datei ihr Label zu:

{ "fileId": "file_abc123", "fileName": "clip-01.txt", "mimeType": "text/plain", "fileUrl": "https://...", "label": "spam" }

Eine Datensatzversion ohne abgeschlossenen Labeling-Lauf liefert keine Grundlage für einen Klassifikations-Trainingsdatensatz — erstellen Sie zuerst einen mit crowd-label-classify.

Finetuning in v1 ist textbasiert. Nicht-textuelle Dateien (Bild/Audio/Video) können weiterhin Teil einer gelabelten Datensatzversion sein, aber Zeilen, die auf sie verweisen, werden beim Aufbau des tatsächlichen Trainingstexts durch den Finetune-Worker übersprungen. Das gilt einheitlich für den gesamten Katalog: Manche Basismodelle (Ministral 3, Gemma 4, Qwen3.5) sind von Haus aus multimodale Checkpoints, aber der Finetune-Worker trainiert stets nur deren Sprachmodell-Komponente auf Textpaaren — nie auf Bildern oder Audio —, sodass die bereitzustellenden Daten unabhängig vom gewählten Basismodell gleich bleiben. Siehe Basismodelle, welche Modelle nativ multimodal sind.

Quelle 2: Die akzeptierten Antworten eines Crowd-Platform-Jobs

Die accepted-Antworten jedes Crowdsourcing-Jobs können zu Trainingsdaten für das Befolgen von Anweisungen werden. Jede Zeile ordnet den Eingabe-Snapshot der Aufgabe des Workers seiner Antwort zu:

{ "input": { "prompt": "..." }, "output": { "category": "..." } }

Das ist nützlich für Aufgaben, bei denen Ihre Crowd bereits die Referenzantworten erstellt hat, die ein Modell reproduzieren lernen soll — zum Beispiel, um eine wiederkehrende Crowd-Aufgabe in ein günstiges Modell zu destillieren, das sie künftig vorfiltert oder automatisiert.

Haben Sie noch keinen solchen Job? Siehe Anweisungs-/Antwort-Vorlage für eine vorgefertigte SurveyJS-Vorlage und eine Schritt-für-Schritt-Anleitung, um einen von Grund auf einzurichten.

Den Datensatz erstellen

POST /v2/ai-platform/finetune-datasets
{ "sourceType": "dataset_version", "datasetId": "dataset_abc123", "versionId": "version_def456" }

oder

{ "sourceType": "crowd_job", "jobId": "job_abc123" }

Die Antwort ist eine finetune_datasets-Zeile: eine id, format (classification oder instruction) und rowCount. Das zugrunde liegende Manifest wird als JSONL in S3 gespeichert — der Finetune-Worker löst Dateiinhalte auf und baut den endgültigen Trainingstext erst zur Trainingszeit auf, sodass dieser Schritt unabhängig von der Dateigröße schnell bleibt.

Nächster Schritt

Wählen Sie ein Basismodell und starten Sie einen Finetuning-Lauf mit dem erstellten Datensatz.

Wie hilfreich ist diese Seite?

© 2026 Crowdee GmbH. Alle Rechte vorbehalten.

On this page