Umfragedaten aufbereiten 2026: Von der Rohdatei über die Kodierung zum fertigen Analysedatensatz

Der Erhebungszeitraum ist vorbei, du lädst die Exportdatei herunter — und blickst auf 214 Zeilen mit Spaltennamen wie «Q7_3» und Zahlenkolonnen ohne Bedeutung. Zwischen dieser Datei und der ersten sinnvollen Auswertung liegen sechs Arbeitsschritte. Wer sie überspringt, rechnet später mit invertierten Items in der falschen Richtung und merkt es erst im Kolloquium.

Kurze Antwort: Die Aufbereitung läuft immer in derselben Reihenfolge: Rohdatei unverändert sichern, Variablen benennen und Messniveaus festlegen, Datenqualität prüfen und ungültige Fälle ausschliessen, invertierte Items umkodieren, Skalenwerte bilden, alles in Codebuch und Syntax dokumentieren. Nimm jede Änderung über eine gespeicherte Syntaxdatei vor, nie per Mausklick — nur so ist deine Auswertung reproduzierbar.

Die Reihenfolge

Die Schritte bauen aufeinander auf, und die Reihenfolge ist nicht beliebig. Wer Skalen bildet, bevor er invertierte Items umkodiert hat, bekommt einen Mittelwert ohne Bedeutung. Wer ungültige Fälle erst nach der Skalenbildung aussortiert, muss alles noch einmal rechnen.

  1. Rohdatei sichern und schreibgeschützt ablegen
  2. Variablen benennen, Wertelabels und Messniveaus setzen, fehlende Werte deklarieren
  3. Datenqualität prüfen, ungültige Fälle nach vorab festgelegten Regeln ausschliessen
  4. Invertierte Items umkodieren, Kategorien bei Bedarf zusammenfassen, Dummys bilden
  5. Skalenwerte berechnen und die interne Konsistenz prüfen
  6. Codebuch und Syntax abschliessen

Rechne für eine typische Fragebogenstudie mit ein bis zwei vollen Arbeitstagen. Das ist keine verlorene Zeit: Fast jeder Fehler, der später im Ergebnisteil auffällt, entsteht in genau diesen Schritten.

Ablaufdiagramm der Datenaufbereitung von der Rohdatei bis zum Analysedatensatz
Sechs Schritte, feste Reihenfolge — jeder übersprungene Schritt kostet später eine komplette Wiederholung.

Rohdatei sichern

Die Datei, die aus dem Umfragewerkzeug kommt, wird nie bearbeitet. Sie bekommt einen Dateinamen mit Datum, wird schreibgeschützt und an zwei Orten abgelegt. Alle weiteren Schritte erzeugen neue Dateien.

Der Grund ist nicht nur Vorsicht. Reproduzierbarkeit heisst, dass sich aus der Rohdatei mit deiner Syntax jederzeit exakt dein Analysedatensatz herstellen lässt. Wenn deine Betreuung fragt, warum n = 198 statt 214 ist, willst du die Antwort nicht rekonstruieren müssen. Die allgemeinen Prinzipien dahinter behandelt der Beitrag zum Forschungsdatenmanagement.

Zwei Dinge trennst du dabei sofort: Kontaktdaten — E-Mail-Adressen für die Verlosung, IP-Adressen, Namen — kommen in eine eigene Datei, die nicht mit den Antworten verknüpft bleibt. Was dabei rechtlich zu beachten ist, wenn du in der Schweiz erhebst, steht im Beitrag zum Datenschutzgesetz bei Befragungen.

Variablen benennen und Messniveaus setzen

Exportierte Spaltennamen sind unbrauchbar. Vergib sprechende, kurze Namen nach einem einheitlichen Muster — Konstruktkürzel plus Itemnummer, alles klein, ohne Leerzeichen, ohne Umlaute: zufr_01 bis zufr_07, betr_01 bis betr_05. Diese Systematik macht später jede Skalenbildung zu einer einzigen Zeile.

Dann setzt du drei Eigenschaften pro Variable:

  • Variablenlabel — der ausgeschriebene Itemtext, damit die Ausgabe lesbar wird.
  • Wertelabels — 1 = «trifft gar nicht zu» bis 5 = «trifft voll zu». Ohne sie liest du später Zahlen und rätst.
  • Messniveau — nominal, ordinal oder metrisch. SPSS nutzt diese Angabe, um Dialoge zu filtern und Diagramme vorzuschlagen; falsch gesetzt, bietet dir das Programm die passende Prozedur gar nicht erst an.

Beim Messniveau lohnt ein bewusster Blick auf Likert-Items. Streng genommen sind sie ordinal; in der Forschungspraxis werden mehrstufige Ratingskalen — vor allem als Skalenmittelwert über mehrere Items — jedoch überwiegend intervallskaliert behandelt. Entscheide dich einmal, begründe es kurz im Methodenteil und bleibe konsequent.

Im selben Durchgang deklarierst du die Codes für fehlende Werte. Ein nicht deklariertes −99 rechnet jedes Programm als echten Zahlenwert mit. Was danach mit den Lücken geschieht, behandelt der Beitrag zu den fehlenden Werten.

Datenqualität prüfen

Jetzt siebst du. Wichtig: Die Ausschlusskriterien legst du fest, bevor du siehst, welche Ergebnisse sie produzieren — sonst wird aus Datenprüfung unbeabsichtigt Ergebnisoptimierung.

Prüfung Wie Typische Regel
Wertebereiche Minimum und Maximum jeder Variablen ansehen Werte ausserhalb des Skalenbereichs sind Codierfehler
Abbrüche Anteil beantworteter Items pro Fall Fälle unter einer vorab gesetzten Quote ausschliessen
Bearbeitungsdauer Zeitstempel des Umfragewerkzeugs unter etwa einem Drittel der Medianzeit ist unplausibel
Durchklicken Streuung der Antworten einer Person über eine Skala Streuung von null über viele Items deutet auf Musterantworten
Dubletten identische Antwortmuster, gleicher Zeitstempel Mehrfachteilnahme, nur einen Fall behalten
Aufmerksamkeitsitems «Kreuzen Sie hier bitte ‹stimme zu› an» nicht bestanden ist ein hartes Ausschlusskriterium

Dokumentiere jeden Ausschluss mit Zahl und Grund. Im Methodenteil steht dann eine Kette wie: «Von 247 begonnenen Bearbeitungen wurden 21 Abbrüche vor der Hälfte des Bogens, 8 Fälle wegen einer Bearbeitungszeit unter drei Minuten und 4 wegen durchgängiger Musterantworten ausgeschlossen; es verbleiben 214 Fälle.» Diese eine Kette beantwortet die meisten Nachfragen zur Stichprobe im Voraus — die Frage, wie gross sie überhaupt sein sollte, klärt vorab der Beitrag zum Bestimmen der Stichprobe.

Umkodieren

Der fehleranfälligste Schritt der ganzen Aufbereitung, und zugleich der mechanischste.

Invertierte Items. Gute Fragebogen enthalten negativ formulierte Items, damit niemand gedankenlos eine Spalte durchkreuzt. «Ich fühle mich in meinem Studium überfordert» misst dasselbe Konstrukt wie «Ich komme mit dem Studium gut zurecht» — nur in umgekehrter Richtung. Vor jeder Skalenbildung drehst du diese Items um. Die Formel ist immer dieselbe: neuer Wert = Minimum + Maximum − alter Wert. Bei einer fünfstufigen Skala von 1 bis 5 also 6 minus alter Wert.

Zwei Regeln dazu, die zusammen fast alle Fehler verhindern:

  1. Immer in eine neue Variable umkodieren, nie das Original überschreiben. Nenne sie zufr_03r, dann ist im Datensatz sichtbar, was passiert ist.
  2. Nach dem Umkodieren gegenprüfen. Eine Kreuztabelle von altem und neuem Item muss eine saubere Diagonale von oben rechts nach unten links zeigen. Dreissig Sekunden Aufwand, die dir eine falsche Auswertung ersparen.

Kategorien zusammenfassen. Alter in Gruppen, Studiengänge in Fachbereiche, sieben Antwortstufen in drei. Das ist erlaubt, kostet aber immer Information und muss inhaltlich begründet sein — nicht damit, dass eine Zelle sonst zu wenig Fälle enthält. Behalte die feine Variante zusätzlich im Datensatz.

Dummy-Variablen. Für Regressionsmodelle brauchst du nominale Merkmale als Nullen und Einsen. Bei k Kategorien bildest du k − 1 Dummys; die weggelassene Kategorie ist die Referenz, gegen die alle Koeffizienten interpretiert werden. Wähle bewusst, welche das ist — üblicherweise die grösste oder die inhaltlich naheliegende Vergleichsgruppe. Wie die Koeffizienten anschliessend zu lesen sind, zeigt der Beitrag zur multiplen Regression in SPSS.

Handschriftliches Codebuch neben dem Laptop mit dem Datensatz
Jede Umkodierung wird im selben Moment notiert, in dem sie gemacht wird — später rekonstruiert sie niemand.

Skalenwerte bilden

Aus sieben Items wird eine Variable. Zwei Wege stehen zur Wahl:

  • Mittelwert der Items. Der Regelfall. Der Skalenwert bleibt auf der ursprünglichen Skala — ein Wert von 4,2 auf einer Fünferskala ist unmittelbar interpretierbar. Ausserdem bleibt er berechenbar, wenn einzelne Items fehlen.
  • Summenscore. In manchen Testverfahren vorgeschrieben, weil Normtabellen darauf beruhen. Er reagiert allerdings empfindlich auf fehlende Items, weil jede Lücke den Wert systematisch senkt.

Wenn du den Mittelwert bildest, lege vorher fest, wie viele Items mindestens beantwortet sein müssen — üblich sind 80 Prozent. Sonst rechnet das Programm für eine Person, die nur zwei von sieben Items ausgefüllt hat, klaglos einen Skalenwert aus.

Vor der Skalenbildung gehört ein Blick auf die interne Konsistenz und die Trennschärfe der Items; die Kennwerte dafür und ihre Schwellen behandelt der Beitrag zu Reliabilität und Validität. Zeigt sich dabei, dass ein einzelnes Item die Skala deutlich schwächt, ist das ein Befund, kein Malheur — dokumentiere die Entscheidung, es zu entfernen, samt Begründung.

Zwei weitere Transformationen, die häufig gebraucht werden: Die z-Standardisierung bringt Variablen mit unterschiedlichen Skalen auf ein gemeinsames Mass und ist nötig, wenn du Kennwerte direkt vergleichen willst. Die Zentrierung am Mittelwert — jeder Wert minus dem Gesamtmittelwert — ist Standard, sobald du Interaktionsterme bildest, weil sie die Koeffizienten interpretierbar hält.

Der Datensatz steht — jetzt das Kapitel dazu. Aufbereitungsschritte, Ausschlussregeln und Skalenbildung gehören nachvollziehbar in den Methodenteil. Mit Tesify formulierst du ihn aus deinem eigenen Vorgehen — strukturiert, belegbar und zu 100 % von dir geschrieben.

Codebuch und Syntax

Zwei Dokumente begleiten den ganzen Prozess, und beide entstehen nebenher — nicht am Schluss.

Das Codebuch ist eine Tabelle mit einer Zeile pro Variable: Variablenname, ausgeschriebener Itemtext, Wertebereich, Wertelabels, Code für fehlende Werte und ein Vermerk, ob und wie umkodiert wurde. Es gehört in den Anhang und beantwortet jede Frage, die eine Zweitgutachterin zum Datensatz haben kann. Nebenbei ist es die einzige Chance, dass du in vier Wochen noch weisst, was betr_04r war.

Die Syntaxdatei ist die eigentliche Versicherung. Jeder Umkodierungs-, Berechnungs- und Auswahlschritt steht darin als Befehl, kommentiert mit dem Grund. In SPSS erzeugst du sie mühelos: Statt im Dialogfenster auf «OK» zu klicken, klickst du auf «Einfügen» — der Befehl landet im Syntaxfenster statt direkt in den Daten. Am Ende lässt sich die ganze Datei in einem Durchgang auf die Rohdaten anwenden.

Der Nutzen zeigt sich immer im selben Moment: Zwei Wochen vor Abgabe fällt auf, dass eine Ausschlussregel anders lauten müsste. Mit Syntax ist das eine geänderte Zeile und ein Klick. Ohne Syntax ist es ein verlorener Tag. Wie du die aufbereiteten Daten anschliessend auswertest, zeigt der Beitrag zur SPSS-Auswertung; welche Verteilungsprüfung vor der Testwahl steht, der Beitrag zum Prüfen der Normalverteilung.

Häufige Fragen

Wie kodiere ich invertierte Items um?

Nach der Formel neuer Wert = Minimum + Maximum − alter Wert. Bei einer Skala von 1 bis 5 also 6 minus dem alten Wert, bei einer Skala von 1 bis 7 entsprechend 8 minus dem alten Wert. Lege dabei immer eine neue Variable an, statt das Original zu überschreiben, und prüfe das Ergebnis mit einer Kreuztabelle von altem und neuem Item — sie muss eine saubere Diagonale zeigen.

Mittelwert oder Summenscore für die Skala?

In der Regel der Mittelwert. Er bleibt auf der ursprünglichen Antwortskala und ist damit direkt interpretierbar, und er lässt sich auch dann noch bilden, wenn einzelne Items fehlen. Der Summenscore ist dann angezeigt, wenn du ein normiertes Testverfahren verwendest, dessen Vergleichswerte auf Summen beruhen — dort ist die Vorgabe des Manuals bindend.

Darf ich Fälle ausschliessen, die zu schnell geantwortet haben?

Ja, sofern du das Kriterium vorher festlegst und es im Methodenteil nennst. Eine verbreitete Regel ist, Bearbeitungszeiten unter etwa einem Drittel der Medianzeit als unplausibel zu werten. Entscheidend ist die Reihenfolge: Das Kriterium wird definiert, bevor du siehst, welche Ergebnisse der Ausschluss produziert. Nachträglich angepasste Regeln sind eine Form der Ergebnisoptimierung.

Sind Likert-Items ordinal oder metrisch?

Streng genommen ordinal, weil die Abstände zwischen den Antwortstufen nicht nachweislich gleich sind. In der Forschungspraxis werden mehrstufige Ratingskalen — besonders als Mittelwert über mehrere Items — jedoch überwiegend wie metrische Variablen behandelt, und Simulationsstudien stützen dieses Vorgehen ab etwa fünf Stufen. Entscheide dich einmal, begründe es in zwei Sätzen und bleibe im ganzen Ergebnisteil konsequent.

Was gehört in ein Codebuch?

Eine Zeile pro Variable mit Variablenname, ausgeschriebenem Itemtext, Wertebereich, Bedeutung der einzelnen Werte, Code für fehlende Werte und einem Vermerk zu Umkodierungen oder Berechnungen. Ergänze bei abgeleiteten Variablen, aus welchen Items sie gebildet wurden. Das Codebuch gehört in den Anhang und macht deinen Datensatz für Dritte lesbar.

Muss ich wirklich mit Syntax arbeiten statt mit Mausklicks?

Vorgeschrieben ist es meist nicht, sinnvoll fast immer. Über Mausklicks veränderte Daten lassen sich nicht rekonstruieren; ändert sich eine Ausschlussregel spät im Prozess, beginnt die gesamte Aufbereitung von vorn. In SPSS kostet es keinen Mehraufwand: Statt im Dialogfenster «OK» zu klicken, klickst du auf «Einfügen», und der Befehl wird im Syntaxfenster gesammelt.

Schreibe deine Abschlussarbeit mit KI

Strukturiere, schreibe und zitiere deine Bachelor- oder Masterarbeit mit einem KI-Assistenten, der wissenschaftliche Integrität wahrt. Kostenlose Anmeldung, ohne Kreditkarte.

Kostenlos starten →

Kategorien