Agentic Market-Data Pipeline
Eine produktive B2B-agentische Datenpipeline (agentic data pipeline), die Domain-Quellen erfasst, strukturierte Signale mit einem LLM extrahiert, angereicherte Marktkommentare generiert und diese nach Zeitplan automatisch auf verschiedenen Kanälen veröffentlicht. Solo gebaut und betrieben.
Book a callLäuft unbeaufsichtigt nach einem täglichen Zeitplan, mit einem harten Stopp bei veralteten Daten und elegantem Fallback bei jedem Schritt.
Fundierte Kommentare, automatisch veröffentlicht
Ein Live-Finanzdatenprodukt benötigte täglich informationsreiche Marktkommentare, die automatisch veröffentlicht werden, ohne dass ein Mensch jedes Update schreibt, und ohne jemals veraltete oder minderwertige Ausgaben zu veröffentlichen.
Der schwierige Teil ist nicht das Generieren von Text. Es geht darum, diesen Text in frischen, realen Signalen zu verankern und die gesamte Kette sicher abbrechen zu lassen, wenn eine Quelle leer ist oder ein vorgelagerter Schritt fehlschlägt.
- Hartes Gate
Datenaktualisierung
Zieht aktuelle Daten. Hartes Gate – wenn es fehlschlägt, bricht der gesamte Durchlauf ab.
Signalextraktion
Scrapt Quellen; LLM extrahiert und konsolidiert Treiber; filtert auf Multi-Source-Signale.
Angereicherte Generierung
Generiert eine fundierte Notiz aus den extrahierten Fakten; veröffentlicht über API.
Automatische Verteilung
Erstellt einen Beitrag + Live-Chart-Screenshot; veröffentlicht mit elegantem Fallback.
Was ich gebaut habe
Eine einzige orchestrierte Pipeline, die nach Zeitplan von Ende zu Ende läuft.
1. Datenaktualisierung (hartes Gate): Zieht die neuesten Marktdaten und fügt sie in die Datenbank ein. Wenn dieser Schritt fehlschlägt, bricht der gesamte Durchlauf ab, sodass niemals veraltete Daten veröffentlicht werden.
2. Signalextraktion: Scrapt die täglichen Quellen, führt eine LLM-Extraktion zur Erkennung von Treibern durch und filtert auf vertrauenswürdige Elemente.
3. Angereicherte Generierung: Generiert eine strukturierte Notiz, die auf den extrahierten Fakten basiert, und veröffentlicht sie über eine API im Produkt.
4. Automatische Verteilung: Erstellt einen passenden Beitrag, macht einen Live-Screenshot des Charts über Headless-Browser-Automatisierung und veröffentlicht ihn.
Jede Stufe läuft stabil: Gibt es an einem Tag kein Signal, wird die Notiz dennoch mit den frischen Basisdaten veröffentlicht. Das System blockiert niemals.
Wichtige technische Entscheidungen
• Fehlersichere Reihenfolge vor Vollständigkeit: Das Daten-Gate garantiert Frische; alles Nachgelagerte ist Best-Effort. Die Veröffentlichung einer sauberen Baseline ist besser als ein fehlerhafter oder veralteter Beitrag.
• Faktendisziplin im LLM-Layer: Ein Multi-Source-Filter und striktes Prompting verhindern, dass das Modell Zahlen erfindet oder irrelevante Schlagzeilen einbezieht – das Hauptrisiko bei generierten Finanzinhalten.
• Lokale Orchestrierung statt Cloud-Routinen: Die Anforderungen an die Browser-Automatisierung und die lokale Umgebung machten einen einzelnen lokalen Orchestrator einfacher und zuverlässiger als eine verteilte Cloud-Infrastruktur.
• Kostengünstig im Betrieb: Auf Edge-Infrastruktur belaufen sich die laufenden Kosten auf wenige Dollar pro Monat.
Stack
Python · OpenAI / Claude (LLM-Orchestrierung) · Model Context Protocol (MCP) · Cloudflare Workers · Edge SQL (libSQL) · Headless-Browser-Automatisierung · Scheduled Task Runner.
Ergebnis
Läuft unbeaufsichtigt nach täglichem Zeitplan: Aktualisiert Daten, extrahiert Treiber, veröffentlicht eine angereicherte Notiz im Produkt und verteilt einen Beitrag mit Live-Chart.
Was ich für Sie bauen kann
Dasselbe Muster ist für jedes Produkt wiederverwendbar, das rohe Quellen in strukturierte, fundierte und automatisch veröffentlichte Inhalte verwandeln muss:
Quellenerfassung → LLM-Extraktion mit Faktentreue → angereicherte Generierung → MCP/API-Veröffentlichung → zeitgesteuerte Automatisierung.
Wenn Sie eine solche Pipeline oder einen API-Wrapper als MCP-Server benötigen, ist das genau mein Spezialgebiet.

