Skip to main content

Agentic Market-Data Pipeline

Celovit agentni podatkovni cevovod (agentic data pipeline), ki zajema domenske vire, z LLM ekstrahira strukturirane signale, ustvarja obogatene tržne komentarje in jih samodejno objavlja na različnih kanalih po urniku. Zgrajeno in upravljano samostojno v produkciji.

Book a call
  • Arhitekt rešitev & tehnični vodja
  • Uporabniški LLM inženiring
  • Integracija agentov & MCP
  • Avtomatizacija podatkov in brskalnika
  • Edge infrastruktura
Deluje v produkciji

Deluje brez nadzora po dnevnem urniku, s trdim zaustavljanjem ob starih podatkih in varnim odstopanjem na vsakem koraku.

Utemeljeni komentarji, objavljeni samodejno

Produktu s finančnimi podatki v živo so bili vsak dan potrebni informativno bogati tržni komentarji, objavljeni samodejno, brez človeškega pisanja vsake posodobitve in brez objavljanja zastarelih ali nekakovostnih vsebin.

Težek del ni ustvarjanje besedila. Gre za utemeljevanje tega besedila v svežih, realnih podatkih in zagotavljanje, da se celotna veriga varno ustavi, če je vir prazen ali če se prejšnji korak zlomi.

  1. Trda vrata

    Osvežitev podatkov

    Pridobi najnovejše podatke. Trda vrata – če spodleti, se celoten zagon prekine.

  2. Ekstrakcija signalov

    Zajema vire; LLM ekstrahira in združuje dejavnike; filtrira na večvirne signale.

  3. Obogatena generacija

    Ustvari utemeljeno zabeležko iz ekstrahiranih dejstev; objavi prek API-ja.

  4. Samodejna distribucija

    Sestavi objavo + posnetek zaslona grafikona v živo; objavi z varnim odstopanjem.

Kaj sem zgradil

En orchestriran cevovod, ki deluje od konca do konca po urniku.

1. Osvežitev podatkov (trda vrata): Pridobi in posodobi najnovejše tržne podatke v bazi. Če ta korak spodleti, se celoten zagon prekine, tako da se nikoli ne objavijo stari podatki.

2. Ekstrakcija signalov: Pregleda dnevne vire, izvede LLM ekstrakcijo katalizatorjev in filtrira na visoko-zanesljive elemente.

3. Obogatena generacija: Ustvari strukturirano zabeležko, utemeljeno izključno na dejstvih, in jo prek API-ja objavi v produktu.

4. Samodejna distribucija: Sestavi primerno objavo, zajame sliko grafikona prek headless brskalnika in jo objavi.

Vsaka faza deluje stabilno: Če ni novih signalov, se zabeležka še vedno objavi s svežimi baznimi podatki. Sistem se nikoli ne zatakne.

Ključne inženirske odločitve

Varna zaporednost pred popolnostjo: Vrata za osvežitev podatkov zagotavljajo svežino; vse ostalo je po svojih najboljših močeh. Objava čiste osnove je boljša od objave zastarelih podatkov.

Podatkovna disciplina v LLM sloju: Filter in stroga navodila preprečujejo modelu, da bi si izmišljal številke ali vključeval nepovezane novice – to je glavno tveganje pri samodejnih finančnih vsebinah.

Lokalna orkestracija namesto spletnih storitev: Zahteve po avtomatizaciji brskalnika in lokalnem okolju so naredile en lokalni orkestrator enostavnejši in zanesljivejši od porazdeljene oblačne infrastrukture.

Poceni delovanje: Na robni (edge) infrastrukturi so stalni stroški le nekaj dolarjev na mesec.

Tehnologije

Python · OpenAI / Claude (LLM orkestracija) · Model Context Protocol (MCP) · Cloudflare Workers · edge SQL (libSQL) · headless avtomatizacija brskalnika · scheduled task runner.

Rezultat

Deluje samostojno po dnevnem urniku: osveži podatke, ekstrahira gonilnike, objavi zabeležko v produktu in distribuira objavo z grafikonom v živo.

Kaj lahko zgradim za vas

Isti vzorec je uporaben za vsak izdelek, ki mora pretvoriti surove vire v strukturirane, utemeljene in samodejno objavljene vsebine:

zajem virov → LLM ekstrakcija z disciplino dejstev → obogatena generacija → MCP/API objava → avtomatizacija po urniku.

Če želite takšen cevovod ali API ovit v MCP strežnik, je to jedro mojega dela.