Wer wissenschaftlich zur frühen Bildung arbeitet, braucht passende Fachliteratur und einen nachvollziehbaren Umgang mit den gefundenen Quellen. Zwischen der ersten Suche und einem nutzbaren Wissensbestand liegen jedoch viele Arbeitsschritte:
- Veröffentlichungen sichten,
- Dubletten erkennen,
- Nutzungsbedingungen prüfen und
- unterschiedliche PDF-Dateien aufbereiten.
Besonders aufwendig wird das, wenn die Literatur anschließend in einem eigenen KI-Wissenssystem durchsuchbar sein soll. Dann zählen neben den wissenschaftlichen Inhalten auch Textstruktur, Quellenzuordnung und die Qualität der technischen Verarbeitung.
Die ECE Wissens-Pipeline von KITA DIGITAL unterstützt diesen Prozess. Sie verbindet die Recherche frühpädagogischer Fachliteratur mit PDF-Verarbeitung, Metadatenverwaltung und einer lokalen KI-gestützten Vorauswahl. Das Ergebnis sind aufbereitete Markdown-Dateien für den anschließenden Import in ein eigenes RAG-System. ECE steht für Early Childhood Education – frühe Bildung beziehungsweise Frühpädagogik.
| Die Pipeline auf einen Blick | Details |
|---|---|
| Anwendungsgebiet | Wissenschaftliche Literatur aus der Frühpädagogik |
| Zielgruppe | Studierende, Forschende, Lehrende und technisch interessierte Fachpersonen |
| Plattform | macOS |
| Ergebnis | Aufbereitete Markdown-Dateien mit zugehörigen Quellen- und Metadaten |
| KI-Prüfung | Lokal mit Ollama und qwen3.8:27b |
| Vorgesehene Nutzung | Studium, Lehre und nichtkommerzielle wissenschaftliche Forschung nach der Projektlizenz |
ECE Wissens-Pipeline auf Zenodo öffnen
Warum Literaturrecherche in der Frühpädagogik eine klare Strategie braucht
Frühpädagogische Fragestellungen berühren unterschiedliche Forschungsbereiche. Wer sich beispielsweise mit sprachlicher Bildung beschäftigt, kann auf erziehungswissenschaftliche, entwicklungspsychologische und sprachwissenschaftliche Veröffentlichungen stoßen. Ein passender Suchbegriff allein reicht deshalb selten aus, um die inhaltliche Eignung einer Quelle zu beurteilen. Auch deutsch- und englischsprachige Begriffe decken sich nicht immer vollständig. „Kindertagesbetreuung“, „Preschool Education“ und „Early Childhood Education and Care“ können unterschiedliche Altersgruppen, institutionelle Strukturen und Forschungskontexte einschließen.
Eine hilfreiche Recherche beginnt daher mit einer eingegrenzten Frage:
- Welche Altersgruppe und welche pädagogische Situation interessieren mich?
- Suche ich empirische Studien, theoretische Beiträge oder Forschungsübersichten?
- Welche Begriffe und verwandten Themen könnten relevante Veröffentlichungen erschließen?
- Welche zeitlichen, sprachlichen oder geografischen Grenzen sind für mein Vorhaben sinnvoll?
Diese Entscheidungen bestimmen, welche Quellen in einen Wissensbestand aufgenommen werden sollten. Eine technische Pipeline kann ihre Umsetzung unterstützen. Die fachliche Begründung der Auswahl bleibt Teil wissenschaftlicher Arbeit.
Was ist RAG – und welche Rolle spielt die Fachliteratur?
RAG steht für Retrieval-Augmented Generation. Dabei werden zu einer Frage passende Inhalte aus einem Wissensbestand gesucht und einem Sprachmodell als zusätzlicher Kontext für die Antwort bereitgestellt. Für einen frühpädagogischen Wissensbestand könnten das Textstellen aus Fachartikeln, Forschungsberichten oder anderen ausgewählten Publikationen sein. Eine tiefere Einführung bietet die wissenschaftliche Veröffentlichung von Lewis und Kolleg zu RAG.
Das Verfahren macht die Quellenaufbereitung besonders wichtig. Wenn ein Dokument fehlerhaft extrahiert wurde, können relevante Aussagen fehlen oder in einem falschen Zusammenhang erscheinen. Wenn dieselbe Veröffentlichung mehrfach im Bestand liegt, kann die Suche wiederholt nahezu identische Textstellen liefern. Eine gut vorbereitete Wissensbasis erleichtert die Suche nach passenden Belegen. Ob eine spätere Antwort diese Belege korrekt verwendet, muss zusätzlich überprüft werden. RAG garantiert weder wissenschaftliche Richtigkeit noch vollständige Antworten. Die ECE Wissens-Pipeline übernimmt die Vorbereitung der Dokumente. Das eigentliche RAG-System für Indexierung, Suche und Antwortgenerierung wird anschließend separat eingerichtet.
Für wen eignet sich die ECE Wissens-Pipeline?
Die Pipeline ist besonders dann interessant, wenn du Literatur wiederholt oder in größerem Umfang für ein eigenes Wissenssystem aufbereitest.
| Einsatzbereich | Möglicher Nutzen |
|---|---|
| Studium und Abschlussarbeiten | Einen thematisch eingegrenzten Literaturbestand für weitere Auswertung und Suche vorbereiten |
| Forschung | Quellen, Bearbeitungsstände und aufbereitete Texte nachvollziehbar zusammenführen |
| Hochschullehre | Die Arbeitsschritte zwischen wissenschaftlicher Publikation und KI-Wissensbasis untersuchen |
| Wissenschaftliches Wissensmanagement | Neue Veröffentlichungen schrittweise in einen bestehenden Bestand einarbeiten |
Für das Lesen und Zitieren weniger Artikel kann eine klassische Literaturverwaltung bereits ausreichen. Der zusätzliche Aufwand einer lokalen Pipeline lohnt sich vor allem, wenn die automatisierte Aufbereitung selbst zu deinem Vorhaben gehört.
Von der wissenschaftlichen Quelle zur RAG-Datei: So arbeitet die Pipeline
Der Verarbeitungspfad verbindet fünf Aufgaben: Recherche, Prüfung von Quelleninformationen, Textaufbereitung, KI-gestützte Vorauswahl und Bereitstellung der Ergebnisse. Ein zentrales Register hilft dabei, bereits bekannte Veröffentlichungen wiederzuerkennen.
1. Frühpädagogische Fachliteratur recherchieren
Die Recherche nutzt unter anderem OpenAlex. Deutsch- und englischsprachige Begriffe aus dem frühpädagogischen Kontext dienen als Ausgangspunkt der Suche. Dazu gehören beispielsweise Frühpädagogik, Kindheitspädagogik, frühe Bildung und Early Childhood Education and Care. Bereits vor dem Download berücksichtigt die Pipeline Relevanzsignale. Denn ein Treffer zum Ausdruck „early childhood“ muss nicht automatisch zu einem frühpädagogischen Wissensbestand passen. Diese Vorauswahl soll offensichtlich unpassende Treffer reduzieren. Sie ist kein Nachweis dafür, dass die Recherche vollständig ist oder jede gefundene Publikation wissenschaftlichen Qualitätsanforderungen genügt.
2. Lizenzinformationen berücksichtigen und Dubletten erkennen
Bei frei zugänglichen Veröffentlichungen prüft die Pipeline verfügbare Open-Access- und Lizenzinformationen. Unklare Nutzungsbedingungen sollen dadurch frühzeitig sichtbar werden. Zur Erkennung bekannter Quellen verwendet sie Merkmale wie OpenAlex-ID und DOI. Zusätzlich berechnet sie für PDFs einen SHA-256-Hash. Dieser Dateifingerabdruck hilft, identische Dateien auch unter unterschiedlichen Namen wiederzuerkennen. Eine überarbeitete PDF kann einen anderen Hash besitzen, obwohl sie zur gleichen Veröffentlichung gehört. Deshalb ergänzen Publikationskennungen und Dateiabgleich einander. Das Ziel ist ein Bestand, in dem Quellen und Bearbeitungsstände nachvollziehbar zugeordnet bleiben.
3. Wissenschaftliche PDFs in Markdown umwandeln
Die Umwandlung erfolgt mit Marker. Aus einer PDF entsteht eine Markdown-Datei, deren Textstruktur sich weiterverarbeiten lässt. PDFs sind auf die Darstellung von Seiten ausgelegt. Bei der Textextraktion können beispielsweise mehrspaltige Abschnitte, wiederkehrende Kopfzeilen oder Fußnoten Schwierigkeiten verursachen. Eine Überschrift, die im PDF optisch eindeutig ist, muss im extrahierten Text nicht zuverlässig als solche erkennbar bleiben. Die anschließende Bereinigung soll technische Artefakte reduzieren und den eigentlichen Text besser nutzbar machen. Dabei dürfen Einschränkungen, methodische Angaben oder Quellenbezüge nicht unbemerkt verloren gehen. Besonders Tabellen und Literaturverweise verdienen eine Kontrolle am Original. Ob ein Literaturverzeichnis in den späteren Suchbestand gehört, sollte anhand des konkreten Anwendungsfalls entschieden werden.
4. Dokumente mit lokaler KI vorprüfen
Für die KI-gestützte Prüfung verwendet die Pipeline Ollama und das lokal installierte Modell qwen3.8:27b. Die Prüfung unterstützt die Einschätzung der fachlichen Relevanz und der Verwendbarkeit des aufbereiteten Textes. Anschließend werden Dokumente drei Bereichen zugeordnet:
| Ergebnis | Bedeutung |
|---|---|
| Freigegeben | Die automatisierten Prüfungen sprechen für die Aufnahme in den vorgesehenen Bestand. |
| Prüfung erforderlich | Technische oder fachliche Unklarheiten benötigen eine manuelle Kontrolle. |
| Ausgeschlossen | Die Quelle wird vom vorgesehenen Bestand ausgeschlossen. |
Eine automatische Freigabe ist kein wissenschaftliches Gütesiegel. Das Modell kann relevante Quellen übersehen oder ungeeignete Dokumente akzeptieren. Ein manueller Prüfbereich macht solche Unsicherheiten bearbeitbar.
5. Ergebnisse archivieren und für RAG bereitstellen
Die finalen Texte werden im Ordner RAG Markdowns Gesamt gesammelt. Dieser Bestand dient als Ausgangspunkt für den Import in ein separates RAG-System. Optional können Original-PDF, aufbereitete Markdown-Datei und Metadaten gemeinsam in DEVONthink archiviert werden. So bleibt die bearbeitete Fassung mit ihrer wissenschaftlichen Quelle verbunden. Das Register _pipeline_verarbeitet.json hält Bearbeitungsstände bekannter Quellen fest. Wird eine verbesserte Fassung erneut freigegeben, kann die vorhandene RAG-Version anhand ihrer Identität aktualisiert werden. Das hilft, unnötige Mehrfachverarbeitung und parallele Bearbeitungsstände zu reduzieren.
Beispiel: Literatur zur sprachlichen Bildung in der Kita vorbereiten
Ein mögliches Anwendungsszenario ist der Aufbau eines Literaturbestands zur sprachlichen Bildung. Das folgende Beispiel beschreibt einen Arbeitsansatz, keinen dokumentierten Testlauf der Pipeline. Am Anfang steht eine eingegrenzte Frage, etwa: Welche Forschungsansätze beschäftigen sich mit sprachlicher Bildung im pädagogischen Alltag von Kindertageseinrichtungen? Für die Recherche können deutsch- und englischsprachige Begriffe zusammengestellt werden. Anschließend werden Treffer daraufhin geprüft, ob sie tatsächlich den interessierenden Altersbereich, die pädagogische Situation und die Fragestellung behandeln. Bei der Aufbereitung zeigt sich beispielsweise, ob eine Publikation als sauberer Text vorliegt, ob Tabellen verständlich geblieben sind oder ob eine Quelle aufgrund unklarer Metadaten manuell geprüft werden muss. Nach dem Import in ein RAG-System lassen sich gezielte Fragen an den vorbereiteten Bestand stellen. Entscheidend ist dann, ob die gefundenen Textstellen die Frage tatsächlich betreffen und ihre Aussagen korrekt wiedergegeben werden.
Eine Studie zu einer bestimmten Intervention sollte beispielsweise nicht ohne Prüfung als allgemeine Empfehlung für sämtliche Kitas dargestellt werden. Population, Untersuchungsbedingungen und methodische Grenzen bleiben für die Einordnung relevant.
Was einen brauchbaren wissenschaftlichen RAG-Bestand ausmacht
Die Zahl der aufgenommenen Dokumente sagt wenig darüber aus, wie hilfreich ein Wissensbestand für eine konkrete Fragestellung ist. Wichtiger sind passende Quellen, brauchbare Texte und nachvollziehbare Belege.
- Thematische Passung: Eine Veröffentlichung sollte zur Forschungsfrage passen. Ein verwandtes Schlagwort allein genügt nicht.
- Erhalt des Zusammenhangs: Ergebnisse sollten zusammen mit den relevanten Bedingungen und Einschränkungen auffindbar sein. Eine Aussage kann missverständlich werden, wenn ihr Kontext verloren geht.
- Quellenzuordnung: Gefundene Textstellen sollten sich eindeutig zur ursprünglichen Publikation zurückverfolgen lassen. Angaben wie Titel, DOI, Jahr und eine passende Fundstelle unterstützen diese Kontrolle.
- Nachvollziehbare Bearbeitung: Originaldatei und aufbereiteter Text sollten gemeinsam verfügbar bleiben. So lässt sich bei Unklarheiten prüfen, ob ein Problem bereits in der Quelle liegt oder bei der Verarbeitung entstanden ist.
- Kontrolle im Zielsystem: Nach dem Import sollten bekannte Fragen mit erwartbaren Fundstellen ausprobiert werden. Auch eine Frage, die der Bestand nicht beantworten kann, ist hilfreich: Das System sollte fehlende Belege erkennbar machen.
Diese Kontrollen betreffen die gesamte Verarbeitungskette. Die hier beschriebene Pipeline stellt dafür die Dokumentengrundlage bereit; die Konfiguration und Bewertung des späteren RAG-Systems bleiben zusätzliche Aufgaben.
Voraussetzungen für die Nutzung auf dem Mac
Die bereitgestellte Version ist für macOS ausgelegt. Benötigt werden eine passende Python-3-Umgebung, Ollama, das vorgesehene Modell und ein eigener OpenAlex-API-Key für den Rechercheprozess der Pipeline.
| Voraussetzung | Aufgabe |
|---|---|
| Mac mit macOS | Ausführung der Setup- und Startdateien |
| Python 3 | Ausführung der Pipeline-Skripte |
| Internetverbindung | Recherche sowie Software-, Modell- und Publikationsdownloads |
| Eigener OpenAlex-API-Key | Zugang für den vorgesehenen Rechercheablauf |
Ollama und qwen3.8:27b | Lokale KI-Prüfung |
| Geeigneter Arbeitsspeicher und freier Speicherplatz | Verarbeitung der Dokumente und Betrieb des lokalen Modells |
| DEVONthink, optional | Nutzung der Archivfunktion |
Plane den Platzbedarf des Modells zusätzlich zu PDFs, Markdown-Dateien und temporären Dateien ein. Die Größe einer Modelldatei entspricht nicht automatisch dem benötigten Arbeitsspeicher. Wie lange ein Durchlauf dauert, hängt unter anderem von Hardware, Dokumentumfang und Beschaffenheit der PDFs ab. Eine Einführung mit einem kleinen Bestand ist deshalb sinnvoll, bevor größere Literaturmengen verarbeitet werden.
Installation: So gelingt der Einstieg
Für den vorgesehenen Standardablauf musst du keinen eigenen Python-Code schreiben. Die mitgelieferten Dateien führen durch Einrichtung und Start. Technische Unterstützung kann dennoch nötig sein, wenn Programme fehlen oder die Systemkonfiguration Probleme verursacht.
- ZIP-Datei vollständig entpacken. Lies zuerst
KITA DIGITAL – START HIER.txtundMACOS – ERSTER START.txt. - Voraussetzungen vorbereiten. Richte Python, Ollama und das Modell entsprechend der Paket-Anleitung ein. Deinen OpenAlex-Key findest du in den API-Einstellungen deines Kontos.
- Skriptordner öffnen. Im Paket führt der Pfad über
ECE WISSENS-PIPELINEund1. PDF überarbeiten für AnythingllmzuPython Scriptprozess. setup.commandausführen. Das Setup richtet die lokale Python-Umgebung mit den benötigten Paketen ein und prüft wichtige Komponenten.start.commandöffnen. Im Menü können einzelne Schritte oder Punkt 5 für den vollständigen Workflow ausgewählt werden.- Ergebnisse am Original kontrollieren. Prüfe zunächst wenige Publikationen und beachte Dokumente im Bereich „Prüfung erforderlich“.
Vor einem vollständigen Durchlauf kontrolliert die Pipeline wichtige Voraussetzungen, beispielsweise Ordnerzugriff, Python-Pakete und die Erreichbarkeit von Ollama. Der OpenAlex-Key wird lokal in pipeline_secrets.json gespeichert. Diese Datei sollte nicht weitergegeben werden. Für spätere Änderungen liegt OpenAlex Key einrichten.command bei. Wenn macOS das Öffnen einer Datei blockiert, beachte die Erststart-Anleitung und die Hinweise von Apple zum sicheren Öffnen von Software. Auf verwalteten Hochschulrechnern kann die Unterstützung der zuständigen IT erforderlich sein.
Open Access, Nutzungsrechte und wissenschaftliche Verantwortung
Frei zugängliche Literatur erleichtert die Recherche. Für die weitere Verarbeitung müssen jedoch die Bedingungen der konkreten Veröffentlichung berücksichtigt werden. Eine kostenlos erreichbare PDF-Datei und eine ausdrücklich erteilte Nutzungserlaubnis sind unterschiedliche Informationen. Die Pipeline berücksichtigt verfügbare Lizenzangaben. Ungeklärte Fälle brauchen weiterhin eine individuelle Prüfung. Die Projektlizenz der Software erteilt keine zusätzlichen Rechte an den verarbeiteten Publikationen. Zur wissenschaftlichen Verantwortung gehört außerdem, die Grenzen automatisierter Verarbeitung sichtbar zu halten. Weder ein erfolgreicher Download noch eine fehlerfrei lesbare Markdown-Datei belegen die methodische Qualität einer Studie. Die fachliche Bewertung sollte deshalb unter anderem Forschungsdesign, untersuchte Population, Aktualität und Übertragbarkeit der Ergebnisse berücksichtigen. Die Pipeline unterstützt die technische Vorbereitung dieser Arbeit.
Häufige Fragen zur ECE Wissens-Pipeline
Ersetzt die Pipeline eine systematische Literaturrecherche?
Nein. Eine systematische Recherche benötigt eine dokumentierte Suchstrategie, begründete Ein- und Ausschlusskriterien sowie eine geeignete Auswahl von Informationsquellen. Die Pipeline kann einzelne technische Schritte unterstützen. Vollständigkeit oder methodische Qualität einer Recherche ergeben sich daraus nicht automatisch.
Ist die Pipeline bereits ein fertiger KI-Chatbot?
Die Pipeline bereitet wissenschaftliche Quellen auf. Für die spätere Beantwortung von Fragen brauchst du zusätzlich ein RAG-System, das die Dateien importiert, durchsucht und passende Textstellen für ein Sprachmodell bereitstellt.
Muss ich Python programmieren können?
Für den vorgesehenen Standardablauf ist kein eigener Python-Code erforderlich. Setup- und Startdateien übernehmen die vorbereiteten Abläufe. Grundkenntnisse im Umgang mit Dateien, Programminstallationen und Fehlermeldungen sind dennoch hilfreich. PyCharm wird nicht benötigt.
Funktioniert die Pipeline unter Windows oder Linux?
Die beschriebene Version ist auf macOS ausgerichtet. Daraus lässt sich keine zugesicherte Unterstützung für Windows oder Linux ableiten. Maßgeblich sind die Angaben und Anleitungen der jeweils veröffentlichten Version.
Werden die Dokumente für die KI-Prüfung an einen externen Chatbot geschickt?
Die beschriebene KI-Prüfung erfolgt lokal über Ollama mit dem installierten Modell. Für Literaturrecherche und Downloads werden externe Dienste angesprochen. Die späteren Datenwege hängen außerdem davon ab, welches RAG-System du verwendest und wie es konfiguriert ist.
Darf ich die Pipeline in einem kommerziellen Projekt einsetzen?
Die bereitgestellte Version ist für Studium, Lehre und nichtkommerzielle wissenschaftliche Forschung vorgesehen. Prüfe für dein Vorhaben die vollständige LICENSE.txt. Eine kommerzielle Nutzungserlaubnis sollte nicht aus der allgemeinen Verfügbarkeit des Downloads abgeleitet werden.
ECE Wissens-Pipeline: Veröffentlichung, Lizenz und Zitierung
Die ECE Wissens-Pipeline v1.0 von KITA DIGITAL – Die KI-Insel der Frühpädagogik wird unter der KITA DIGITAL Academic & Research License v1.0 bereitgestellt. Das Softwarepaket enthält die Pipeline-Skripte, Setup- und Startdateien, die Einrichtung des OpenAlex-Keys, Konfigurationsdateien und Anleitungen. Die verbindlichen Projektbedingungen stehen in LICENSE.txt; Hinweise zu Drittkomponenten finden sich in THIRD_PARTY_NOTICES.md. Für externe Dienste, Software und Modelle gelten deren eigene Bedingungen und gegebenenfalls Kosten oder Nutzungslimits.
ECE Wissens-Pipeline auf Zenodo öffnen
Projekt-DOI: 10.5281/zenodo.23182511
Wenn du die Pipeline in einer wissenschaftlichen Arbeit verwendest, übernimm die bibliografischen Angaben aus der zugehörigen Zenodo-Veröffentlichung. Achte darauf, die tatsächlich verwendete Softwareversion zu zitieren. Mit der ECE Wissens-Pipeline möchte ich die technische und organisatorische Arbeit an frühpädagogischen Literaturbeständen erleichtern. Originalquelle, Verarbeitung und Ergebnis sollen nachvollziehbar verbunden bleiben. Darauf können weitere Projekte in Studium, Lehre und Forschung aufbauen.
Entwicklung und Herausgabe: KITA DIGITAL – Die KI-Insel der Frühpädagogik
Autorenprofil: ORCID 0009-0003-9200-7794
