Lapis & Amber
Grundidee (Kernaussage)
Lapis Amber Survey ist ein Open-Source-Befragungssystem, das drei Probleme löst, die kein bestehendes Tool gelöst hat:
1. Paradata-First — Verhaltensrohdaten aus dem Ausfüllprozess sind nativ integriert, nicht nachgerüstet. 2. Datensouveränität — Die Daten bleiben physisch beim Forschenden, bis hin zur KI-Analyse lokal. 3. KI-gestützter Design-Loop — KI-Agenten unterstützen beim Erstellen, Prüfen und Verbessern von Fragebögen — und lernen aus den eigenen Paradata.
Zielgruppe: Empirische Sozialforschung, Methodenlabore, Institutionen mit Datenschutzanforderungen, Feldforschung ohne Internetanschluss.
Vier Kern-Differenzierungsmerkmale
1. Paradata-Engine (Alleinstellungsmerkmal)
Paradata = Prozessdaten aus dem Ausfüllverhalten (Antwortzeiten, Revisionen, Scrolltiefe, Mausbewegungen, Tipp-Pausen)
Problem heute: Kein Tool erfasst das nativ. Forscher bauen eigene JS-Snippets, verlieren Daten bei Abbrüchen, haben keinen methodischen Standard. Unser Ansatz: Nativ im Survey-Runner eingebaut. Drei Granularitätsmodi wählbar. Reaktives Feedback in Echtzeit ist geplant (Survey reagiert auf Verhalten — siehe Abschnitt „Reaktive Surveys" weiter unten). Wissenschaftliche Grundlage: Schlosser & Höhne (2020) ECSP-Framework, erweitert auf Item-Ebene.
2. Deployment-Tiers (Nutzungsmodell)
Vier Stufen — von der Eigeninstallation bis zum vollständig betriebsbereiten Gerät:
| Tier | Name | Nutzung | Offline? |
|---|---|---|---|
| 1 | DIY | Selbst installieren (ISO/Docker) | optional |
| 2 | Ready | Personalisiertes ISO, auf eigener Hardware | optional |
| 3 | Turnkey | Gemieteter Mini-PC, steckdosenfähig | ✓ |
| 4 | AI-Onsite | GPU-Rechner mit lokalem LLM | ✓ |
3. Offline-Hotspot-Betrieb (Tier 3+4)
- Gerät spannt eigenes WLAN auf.
- Befragte nutzen Smartphones/Tablets — kein Internet nötig.
- Einsatz: Dörfer, Messen, Gefängnisse, Kliniken, Entwicklungsländer.
4. Markdown-basierte Survey-Definition (.survey.md)
Fragebögen müssen nicht über eine Web-Oberfläche eingegeben werden — sie können als einfache Textdatei geschrieben, versioniert und per LLM generiert werden.
---
title: Arbeitszufriedenheit 2026
protection_level: 2
preregistration: osf:abc123
---
## Seite 1 | Einstieg
### q1 | Wie zufrieden sind Sie mit Ihrer Arbeit? {scale:1-5}
### q3 | Arbeitszeit {single}
- [ ] Vollzeit
- [ ] Teilzeit
## Seite 2 | Vertiefung {if: q1 <= 2}
### q4 | Was würde sich ändern müssen? {textarea}
- Versionierbar in Git (diff zeigt genau was sich am Fragebogen geändert hat).
- LLMs können Surveys auf Zuruf generieren, kritisieren, übersetzen.
- Obsidian / VS Code als alternativer Designer.
- Web-GUI und
.survey.mdsind gleichwertige Eingabeformate — bidirektionaler Export.
5. KI-Agenten im Survey-Design-Loop
Der entscheidende Unterschied zu "KI-Buttons" in Qualtrics & Co.: die KI kennt die eigenen Paradata und schließt den Kreislauf zwischen Design, Feldphase und nächster Studie.
Design-Phase Feldphase Auswertung / Lernen
──────────────────────────────────────────────────────────────────────────
KI-Agent Paradata-Engine KI-Agent
generiert Survey → erfasst Verhalten → analysiert Ergebnisse
nach Hypothesen (Revisionen, Abbrüche, "Item q3: 4× überarbeitet,
Verweildauer, Scroll) Formulierung unklar"
↑ │
└──────────────────────────────────────────────────────┘
Feedback-Loop
Survey-Agenten (entwickelbar als OpenSpace-Skills):
| Agent | Aufgabe | Grundlage |
|---|---|---|
item-critic | Doppelläufige Fragen, Verneinungen, Fremdwörter erkennen | ZUMA, ZIS, APA-Richtlinien |
scale-advisor | Optimales Antwortformat wählen (Likert / VAS / Ranking) | Psychometrische Literatur |
hypothesis-gap | Prüft ob alle Items für Auswertungshypothesen vorhanden sind | Präregistrierung + Logik |
paradata-critic | Lernt aus eigenen Daten: welche Items erzeugen Abbrüche/Revisionen | Eigene Paradata |
zis-recommender | Sucht validierte Items in der Fragedatenbank statt neue zu erfinden | ZIS-Import |
translation-agent | Mehrsprachige Versionen erzeugen und auf Äquivalenz prüfen | Übersetzungsforschung |
Wichtiges UX-Prinzip: Die KI schlägt vor mit Begründung und Quellenangabe — der Forscher entscheidet. Kein Auto-Apply.
→ *Vollständige Bibliothek: 21 Agenten in 6 methodischen Ebenen (Regel-basiert bis LLM-intensiv) — siehe unten: „KI-Agenten: Vollständige Bibliothek"*
DSGVO & Datensicherheit
Grundprinzip: Privacy by Design
- Paradata gilt als personenbezogenes Datum → Einwilligung vor Erfassung.
- Technische Schutzstufen steuern, was erfasst werden darf.
Vier DSGVO-Schutzstufen (technisch durchgesetzt)
| Stufe | Erfasste Events | Einsatz |
|---|---|---|
| 1 — Minimal | Nur Lifecycle (Seitenstart/-ende, Abbruch, Submit) | Default, keine Extra-Einwilligung nötig |
| 2 — Standard | + Antwortzeiten, Revisionen, Fokus/Blur, Scroll | Standard-Forschung mit Einwilligung |
| 3 — Erweitert | + Mausbewegungen, Touch-Pfade, Tipp-Pausen | Intensive Methodenstudien |
| 4 — Vollständig | + Gerätebewegung, Umgebungslicht, kontinuierlich | Labor-Studien, vollständige Einwilligung |
- Nicht erlaubte Events werden im Browser gefiltert — verlassen nie das Gerät.
- Anonymisierungsoption: Paradata nur aggregiert speichern (kein Response-Linking).
Datenspeicherung
- Paradata und Antwortdaten technisch getrennt (eigene Tabellen, verknüpft via
response_id). - Self-Hosting: Daten verlassen nie den eigenen Server.
- Tier 4: Auch KI-Auswertung läuft lokal (Ollama) — kein Cloud-API-Call.
Forschungsfeatures
Präregistrierung
- OSF-kompatibles Zeitstempel-Format vor Feldstart.
- Technische Trennung: konfirmatorische vs. explorative Hypothesen.
- Unveränderlicher Audit-Trail nach Registrierung.
Reaktive Surveys (geplant)
- Fast Rule Engine im Browser: Survey reagiert in <1ms auf Verhalten.
- Beispiele: Hilfebox erscheint bei langer Antwortzeit, Sprache wechselt bei Frustrationssignal, Item-Reihenfolge passt sich an.
- Feedback-Loop: ML-Pipeline auf Server analysiert Stream → Reaktionen zurück via WebSocket.
Paradata als Forschungsobjekt (nicht nur Qualitätssignal)
- Export: CSV / SPSS / JSON — alle Rohdaten zugänglich.
- Indikatorberechnung: Response-Zeiten, Revisionsraten, Scrolltiefe, Gerätebewegung.
- Basis für eigene Analysen (kein proprietäres Format).
Technische Architektur
Stack
| Komponente | Technologie |
|---|---|
| Backend | FastAPI (Python) |
| Datenbank | PostgreSQL + SQLite (Dev) |
| Paradata-Frontend | Vanilla JS ES2022, Rollup 4 |
| Paradata-Transport | WebSocket + sendBeacon-Fallback |
| KI-Auswertung (Tier 4) | Ollama (lokal) |
| Deployment | Docker Compose |
| Tests | pytest (Backend), Vitest 2 (Frontend, 48 Tests) |
Paradata-Datenfluss
Browser Server Storage
────────────────────────────────────────────────────────────────────
Collector → DSGVO-Filter WebSocket-Receiver paradata_events (raw)
→ BatchBuffer → → DSGVO-Filter (Server) → paradata_indicators (item)
→ Transport → Persist async paradata_quality (aggregiert)
→ Reaktions-Queue
↑↓ WebSocket
sendBeacon (Abbruch) → /flush (garantierte Lieferung)
Granularitätsmodi
| Modus | Verhalten | Einsatz |
|---|---|---|
page_level | Events nur bei Seitenwechsel | ECSP-kompatibel, minimal |
item_level (default) | Events pro Item-Interaktion | Standard |
continuous | Echtzeit-Streaming | Enterprise / KI |
Deployment-Details pro Tier
Tier 1 — DIY
- Generisches Docker-Image / ISO:
docker compose up. - Keine Gewährleistung, Community-Support.
- Geeignet: Entwickler, IT-affine Forscher.
Tier 2 — Ready
- Personalisiertes ISO wird beim Download server-seitig erzeugt (Fragebogen eingebettet).
- Auf eigene Hardware (Raspberry Pi bis Mini-PC).
- Einfache Web-Oberfläche zur Einrichtung.
Tier 3 — Turnkey
- Gemieteter Mini-PC (Whitelist-Hardware, getestet).
- Vorinstalliert: Steckdose + Netzwerk → sofort startklar.
- WLAN-Hotspot integriert für Offline-Feldforschung.
- Kryptographischer Wipe nach Rückgabe (Datenschutz).
- Fernwartung nur auf expliziten Auftrag.
Tier 4 — AI-Onsite
- Leistungsstarker GPU-Rechner (Leasing-Modell).
- Lokales LLM via Ollama (kein Cloud-API-Call).
- Offene Antworten → automatische Themenextraktion, Sentiment, Kategorisierung.
- Paradata → ML-Pipeline vollständig lokal.
- Volle Datensouveränität auch für KI-gestützte Auswertung.
.survey.md Syntax-Referenz (Kurzform)
--- # Frontmatter (YAML)
title: Studientitel
protection_level: 2 # DSGVO-Stufe 1–4
language: de
randomize_pages: false
preregistration: osf:abc123 # OSF-Präregistrierungs-ID
---
## Seitenname | Angezeigte Überschrift # Neue Seite
{if: q1 <= 2} # Bedingung (optional)
> Instruktionstext # Markdown-Blockquote = Instruktion
### item_id | Itemtext {Typ, Optionen} # Frage
# Typen:
# {scale:1-5, labels:"gar nicht","sehr"} Likert / VAS
# {single} + Bullet-Liste Einfachauswahl
# {multi} + Bullet-Liste Mehrfachauswahl
# {text} Kurztext
# {textarea} Freitext
# {matrix} + Bullet-Liste Matrixfrage
# Optionen:
# required, dsgvo_level:3, randomize, placeholder:"...", other
Positionierungsaussagen (für die Grafik)
„Paradata ist unser Betriebssystem — nicht ein Feature."
„Die Daten gehören dem Forschenden. Physisch."
„Von der Felderhebung ohne Internet bis zur KI-Auswertung ohne Cloud — alles in einem System."
„Methodisch sauber: Präregistrierung, DSGVO-Stufen und Paradata-Export sind keine Extras."
„Der Fragebogen ist eine Textdatei. Versioniert, LLM-generierbar, offen."
„Wir bauen die Methodenkompetenz in das Tool ein — nicht als PDF-Anhang."
„Der Item-Hub ist das npm für Forschungsfragen — und wir wollen ihn bauen."
Einsatzszenarien
Sofort realisierbar
1. Akademische Felderhebung, DSGVO-konform: Institut hostet eigene Instanz, Paradata für Methodenanalyse, OSF-Präregistrierung per Klick. Heute: LimeSurvey ohne Paradata oder Qualtrics (teuer, Cloud).
2. Offline-Feldstudie: Turnkey-Gerät im Dorf ohne Internet — Smartphones verbinden sich per WLAN-Hotspot, Daten bleiben lokal. Heute: Papier + manuelle Digitalisierung.
3. Longitudinales Panel mit Paradata-Tracking: paradata-critic-Agent erkennt aus Panel-Welle 1, welche Items Frustration erzeugen — verbessert Welle 2 automatisch. Heute: unmöglich ohne Custom-Dev.
Mittelfristige Vision
4. Item-Hub-Integration: Forscher sucht validierte Items zum Konstrukt „Arbeitszufriedenheit" — zis-recommender-Agent schlägt ZIS-Items vor, direkt importierbar ins .survey.md. Spart Zeit, erhöht Replizierbarkeit.
5. Partizipative Forschung (Entwicklungsländer, NGOs): Tier-3-Gerät + Offline + Lokalsprache (translation-agent) + lokale KI-Auswertung (Tier 4). Kein Internet, keine Cloud, keine IT-Abteilung nötig.
6. Multi-Site-Studie: Gleiches .survey.md in Git, mehrere Institute klonen und betreiben eigene Instanzen. Versionskontrolle zeigt exakt, wo welches Institut Änderungen gemacht hat — methodische Transparenz auf Ebene des Quelltexts.
KI-Agenten: Vollständige Bibliothek
*21 Agenten in 6 methodischen Ebenen. Implementierungstier: 1 = Regex/NLP, 2 = Klassifikator/einfaches Modell, 3 = LLM-intensiv.*
Ebene 1 — Item-Qualität
| Agent | Aufgabe | Methodische Grundlage | Tier |
|---|---|---|---|
DoubleBarrelDetector | Doppelläufige Fragen erkennen (und, sowie) | Fowler 1995, Menold 2020 | 1 |
NegationAnalyzer | Verneinungen + Doppelnegationen | Rugg 1941 (Holocaust-Studie), IEA 2024 | 1 |
LeadingQuestionDetector | Suggestivfragen, Autoritätsverweis, Wertung im Fragestamm | AAPOR Best Practices 2022 | 1–2 |
ReadabilityChecker | Satzlänge, Subordinationstiefe, Fremdwortdichte | Lenzner 2014, QUAID-Framework | 1 |
VagueReferenceDetector | Vage Zeitangaben, unklare Pronomen, falsche Presuppositionen | Graesser et al. 2000 (QUAID), Tourangeau 2000 | 1 |
SocialDesirabilityFlagger | Themen mit Selbstdarstellungsbias — schlägt Forgiving Wording vor | Bogner & Landrock 2015 (GESIS) | 2 |
Ebene 2 — Skalendesign
| Agent | Aufgabe | Methodische Grundlage | Tier |
|---|---|---|---|
ScaleTypeAdvisor | Skalentyp-Empfehlung (Likert/VAS/Semantic Differential/Ranking) | Krosnick & Fabrigar 1997, Revilla et al. 2014 | 2 |
AnchorLabelAuditor | Vollständige Verbalisierung, Balancierung, Polungskonsistenz | Krosnick 1991, GESIS Ratingskalen-Guidelines | 1 |
MidpointAdvisor | Neutralkategorie und „Weiß nicht"-Option prüfen | Krosnick & Fabrigar 1997, Satisficing-Literatur | 1 |
Ebene 3 — Fragebogen-Struktur
| Agent | Aufgabe | Methodische Grundlage | Tier |
|---|---|---|---|
OrderEffectAnalyzer | Kontext-, Assimilations- und Kontrasteffekte durch Reihenfolge | Schwarz & Strack 1991, Tourangeau et al. 2000 | 2 |
FunnelStructureChecker | Trichtereffekt, sensible Fragen am Ende, Sociodem-Platzierung | Dillman et al. 2014 (Tailored Design Method) | 2 |
GridMatrixWarner | Lange Matrizen → Straightlining; Matrix auf Mobile → Fehler | Krosnick 1991, Couper et al. 2013 | 1 |
Ebene 4 — Konstruktspezifisch
| Agent | Aufgabe | Methodische Grundlage | Tier |
|---|---|---|---|
AttitudeScaleCrafter | Einstellungsobjekt klar, kognitive/affektive/konative Komponenten | Ajzen & Fishbein 1980, ESS Item Development Protocol | 3 |
BehaviorFrequencyAgent | Zeitrahmen, Telescoping-Fehler, Verhaltensanker statt Häufigkeitsurteil | Tourangeau Retrieval Stage, Sudman & Bradburn 1973 | 2 |
DemographicsValidator | MECE-Kategorien, ISCED-Kompatibilität, Datenschutz | GESIS Sozialer Survey, Statistisches Bundesamt | 1 |
PsychometricScaleAuditor | Validierte Skalen prüfen (Item-Anzahl, Polung, Zeitbezug, Quelle) | APA Measurement Standards, SQP 3.0 | 2–3 |
Ebene 5 — Responserate & UX
| Agent | Aufgabe | Methodische Grundlage | Tier |
|---|---|---|---|
CompletionRateOptimizer | Abbruchrisiko schätzen, Bearbeitungszeit, Progress-Bar-Position | Dillman et al. 2014, Meta-Analyse Progress Indicators | 2 |
MobileCompatibilityChecker | Matrix/Grid auf Mobile → Fehler; Touch-Kompatibilität | Peytchev & Hill 2010, Survey Practice Journal | 1 |
InstructionClarityAgent | Einleitungen, Übergangsformulierungen, Anonymitätskommunikation | Dillman 2014, ESS Interviewer Guidelines | 2 |
Ebene 6 — Übergreifend
| Agent | Aufgabe | Methodische Grundlage | Tier |
|---|---|---|---|
PreTestSimulator | Kognitiver Interview-Durchlauf simulieren (Tourangeau 4-Stage) | Tourangeau et al. 2000, Willis 2005 | 3 |
QualityScoreAggregator | Gesamtscore + priorisierte Mängelliste (FEHLER / WARNUNG / INFO) | SQP 3.0 Qualitätsdimensionen, DeGEval-Standards | 3 |
Externe API: SQP 3.0 API (GESIS) liefert Reliabilitäts-/Validitätsschätzungen direkt aus Item-Text — RoBERTa-basiertes Modell (JRSS-A 2026). Direct integration mit PsychometricScaleAuditor und QualityScoreAggregator.
Community-Infrastruktur: Der Item-Hub
Problem: ZIS (GESIS), IPIP und OSF haben tausende validierte Items — aber keiner bietet eine maschinenlesbare API. Forscher tippen Items ab oder kopieren aus PDFs.
Vision: Ein npm-artiges Repository für validierte Survey-Items — durchsuchbar, zitierbar, direkt importierbar.
# .survey.md — Item direkt aus Hub importieren
### q5 {from: "zis:jobsat-2022-4items", protection_level: 2}
### q12 {from: "ipip:big5-openness-10items"}
Komponenten:
item-search-API: Volltextsuche + Filterung (Konstrukt, Sprache, Skala, Validierungsstudie)zis-recommender-Agent: schlägt Items basierend auf Präregistrierungshypothesen vor- Community-Beiträge: Forscher teilen Items (DOI, Zitierung, Lizenz)
- Qualitätsscore via SQP 3.0 API
Strategischer Vorteil: Lapis Amber Survey nutzt mit .survey.md ein maschinenlesbares Format — Item-Hub-Integration ist ein natürlicher nächster Schritt. Für GUI-zentrische Tools wäre das ein fundamentaler Architekturbruch.
OSF-Direkt-Integration: OSF bietet eine vollständige REST-API (JSON:API) — One-Click-Präregistrierung aus Lapis Amber Survey heraus ist technisch sofort umsetzbar.