Skip to main content

Agentic Market-Data Pipeline

Eine produktive B2B-agentische Datenpipeline (agentic data pipeline), die Domain-Quellen erfasst, strukturierte Signale mit einem LLM extrahiert, angereicherte Marktkommentare generiert und diese nach Zeitplan automatisch auf verschiedenen Kanälen veröffentlicht. Solo gebaut und betrieben.

Book a call
  • Lösungsarchitekt & Tech Lead
  • LLM-Informatik & Prompting
  • Agenten- & MCP-Integration
  • Daten- & Browser-Automatisierung
  • Edge-Infrastruktur
Im Produktionsbetrieb

Läuft unbeaufsichtigt nach einem täglichen Zeitplan, mit einem harten Stopp bei veralteten Daten und elegantem Fallback bei jedem Schritt.

Fundierte Kommentare, automatisch veröffentlicht

Ein Live-Finanzdatenprodukt benötigte täglich informationsreiche Marktkommentare, die automatisch veröffentlicht werden, ohne dass ein Mensch jedes Update schreibt, und ohne jemals veraltete oder minderwertige Ausgaben zu veröffentlichen.

Der schwierige Teil ist nicht das Generieren von Text. Es geht darum, diesen Text in frischen, realen Signalen zu verankern und die gesamte Kette sicher abbrechen zu lassen, wenn eine Quelle leer ist oder ein vorgelagerter Schritt fehlschlägt.

  1. Hartes Gate

    Datenaktualisierung

    Zieht aktuelle Daten. Hartes Gate – wenn es fehlschlägt, bricht der gesamte Durchlauf ab.

  2. Signalextraktion

    Scrapt Quellen; LLM extrahiert und konsolidiert Treiber; filtert auf Multi-Source-Signale.

  3. Angereicherte Generierung

    Generiert eine fundierte Notiz aus den extrahierten Fakten; veröffentlicht über API.

  4. Automatische Verteilung

    Erstellt einen Beitrag + Live-Chart-Screenshot; veröffentlicht mit elegantem Fallback.

Was ich gebaut habe

Eine einzige orchestrierte Pipeline, die nach Zeitplan von Ende zu Ende läuft.

1. Datenaktualisierung (hartes Gate): Zieht die neuesten Marktdaten und fügt sie in die Datenbank ein. Wenn dieser Schritt fehlschlägt, bricht der gesamte Durchlauf ab, sodass niemals veraltete Daten veröffentlicht werden.

2. Signalextraktion: Scrapt die täglichen Quellen, führt eine LLM-Extraktion zur Erkennung von Treibern durch und filtert auf vertrauenswürdige Elemente.

3. Angereicherte Generierung: Generiert eine strukturierte Notiz, die auf den extrahierten Fakten basiert, und veröffentlicht sie über eine API im Produkt.

4. Automatische Verteilung: Erstellt einen passenden Beitrag, macht einen Live-Screenshot des Charts über Headless-Browser-Automatisierung und veröffentlicht ihn.

Jede Stufe läuft stabil: Gibt es an einem Tag kein Signal, wird die Notiz dennoch mit den frischen Basisdaten veröffentlicht. Das System blockiert niemals.

Wichtige technische Entscheidungen

Fehlersichere Reihenfolge vor Vollständigkeit: Das Daten-Gate garantiert Frische; alles Nachgelagerte ist Best-Effort. Die Veröffentlichung einer sauberen Baseline ist besser als ein fehlerhafter oder veralteter Beitrag.

Faktendisziplin im LLM-Layer: Ein Multi-Source-Filter und striktes Prompting verhindern, dass das Modell Zahlen erfindet oder irrelevante Schlagzeilen einbezieht – das Hauptrisiko bei generierten Finanzinhalten.

Lokale Orchestrierung statt Cloud-Routinen: Die Anforderungen an die Browser-Automatisierung und die lokale Umgebung machten einen einzelnen lokalen Orchestrator einfacher und zuverlässiger als eine verteilte Cloud-Infrastruktur.

Kostengünstig im Betrieb: Auf Edge-Infrastruktur belaufen sich die laufenden Kosten auf wenige Dollar pro Monat.

Stack

Python · OpenAI / Claude (LLM-Orchestrierung) · Model Context Protocol (MCP) · Cloudflare Workers · Edge SQL (libSQL) · Headless-Browser-Automatisierung · Scheduled Task Runner.

Ergebnis

Läuft unbeaufsichtigt nach täglichem Zeitplan: Aktualisiert Daten, extrahiert Treiber, veröffentlicht eine angereicherte Notiz im Produkt und verteilt einen Beitrag mit Live-Chart.

Was ich für Sie bauen kann

Dasselbe Muster ist für jedes Produkt wiederverwendbar, das rohe Quellen in strukturierte, fundierte und automatisch veröffentlichte Inhalte verwandeln muss:

Quellenerfassung → LLM-Extraktion mit Faktentreue → angereicherte Generierung → MCP/API-Veröffentlichung → zeitgesteuerte Automatisierung.

Wenn Sie eine solche Pipeline oder einen API-Wrapper als MCP-Server benötigen, ist das genau mein Spezialgebiet.