SYSTEM-STATUS: OPERATIONAL [EU-DE-NODE]

Agentic Infrastructure ///

Fünf Signale, die verraten, ob eine Domain für Maschinen bereit ist

KI-Zusammenfassung / tl;dr

  • TARGET_ENTITY: InfraCheck (Open-Source-Pre-Flight-Scanner, MIT-Lizenz)
  • FUNCTION: Prüft jede Domain auf fünf maschinenlesbare Signale und liefert in unter 3 Sekunden ein binäres PASS/FAIL
  • SIGNALS: JSON-LD-Validität, llms.txt-Vorhandensein, robots.txt-Bot-Direktiven, HTTP-Security-Header, SSL/TLS
  • FINDING: 42% von 400 regulierten Domains lieferten null valides JSON-LD; 82% hatten keine llms.txt
  • CORE_THESIS: Jede Retrieval-Pipeline nimmt an, dass die Quelle strukturierte, maschinenlesbare Daten liefert. Die meisten regulierten Domains tun das nicht. InfraCheck ist ein Pre-Flight-Check: Er sagt Ihnen, ob die Tür offen ist, bevor Ihre Pipeline Tokens für die Extraktion verbrennt und Rauschen zurückbekommt. Er deckt fünf der 183 Signale des vollständigen SOVP-Scans ab — die binäre Schicht, die unter Inhaltsqualität, Aktualität und Korrektheit liegt.

Ich scanne Websites beruflich. Ich betreibe einen Batch-Scanner über 559 Domains in 10 regulierten DACH-Branchenlisten: DAX 40, BaFin-regulierte Finanzunternehmen, Betreiber kritischer Infrastruktur, Behördenportale, Gesundheitswesen, Automotive, E-Commerce. Jede Domain durchläuft 183 Signalprüfungen. Die Ergebnisse fließen in kryptografisch signierte Infrastruktur-Attestierungen ein.

Dieser vollständige Scan dauert 30 Minuten. Manchmal brauche ich einfach eine schnelle Antwort: Kann sich ein automatisiertes System auf diese Domain als Datenquelle verlassen? Fünf Signale geben mir diese Antwort in unter 3 Sekunden.

Um diese fünf Signale herum habe ich ein CLI-Tool gebaut. Dieser Beitrag erklärt, was jedes davon misst, warum es wichtig ist und wo die Grenzen liegen.

Das Problem hinter dem Tool

42% von 400 Domains in meinem August-2026-Batch lieferten null valides JSON-LD. 82% hatten keine llms.txt-Datei. Das sind Domains aus Finanzwesen, Gesundheitswesen, Behörden und E-Commerce. Die regulierten Branchen. Diejenigen, die KI-Strategien mit siebenstelligen Budgets aufbauen.

Jede Retrieval-Pipeline nimmt an, dass die Quelle strukturierte, maschinenlesbare Daten liefert. Ich habe vor zwei Jahren aufgehört, das anzunehmen. Seither messe ich jede Quelle, bevor sie in irgendeine Pipeline gelangt. Die Lücke zwischen Annahme und Messung ist genau der Ort, an dem Extraktionskosten explodieren und Halluzinationen entstehen.

Die fünf Signale

1. JSON-LD. Die Startseite bekommt eine GET-Anfrage. Jeder <script type="application/ld+json">-Block läuft durch json.loads. Wenn das JSON parst und einen validen @type trägt, besteht die Prüfung.

168 dieser 400 Domains hatten einen JSON-LD-Block im HTML. Der Block existierte. Er enthielt leere Typen, kaputte Verschachtelung, abgeschnittene Strings. Ein fehlerhafter Block ist der gefährlichere Fall: Ihre Pipeline sieht Daten, versucht sie zu parsen und extrahiert Müll.

2. llms.txt. Der llms.txt-Standard (vorgeschlagen von Jeremy Howard) gibt Sprachmodellen eine maschinenlesbare Zusammenfassung einer Website. Die Verbreitung liegt bei 18% über meine 559 gescannten Domains. Zwei Guard-Clauses fangen False Positives ab: eine Content-Type-Prüfung filtert HTML-Fehlerseiten heraus, die mit Status 200 ausgeliefert werden, und eine Präfix-Prüfung fängt Soft-404-Seiten ab, die unter dem /llms.txt-Pfad ein HTML-Dokument zurückgeben.

3. robots.txt. Zwei Fragen zählen. Kann ein generischer Bot die Website überhaupt crawlen? Und schließt die Website bekannten KI-Crawlern wie GPTBot, ClaudeBot oder PerplexityBot ausdrücklich die Tür? Das Tool parst jedes User-agent/Disallow-Paar und gleicht es gegen eine Liste von 10 bekannten KI-Bot-Kennungen ab.

4. HTTP-Security-Header. Eine Domain, die Strict-Transport-Security und X-Content-Type-Options ausliefert, betreibt einen gepflegten Stack. Ich verfolge 10 Branchenlisten. Das Muster wiederholt sich in jeder einzelnen: Domains, die bei Strukturdaten scheitern, scheitern auch bei Security-Headern. Zwei von vier geprüften Headern müssen vorhanden sein.

5. SSL/TLS. Die kürzeste Prüfung. Wenn der HTTPS-Handshake bricht, ist alles andere akademisch.

Die Urteilslogik

Eine Domain besteht, wenn mindestens 3 von 5 Prüfungen erfolgreich sind. Der Schwellenwert steht als Konstante am Anfang des Skripts. Ich habe 3 gewählt, weil SSL allein einen nahezu universellen Pass ausmacht und das Vorhandensein von robots.txt häufig genug ist, um den meisten Domains einen zweiten Gratispunkt zu geben. Das dritte Signal trennt Domains, die aktiv maschinenlesbare Infrastruktur bereitstellen, von jenen, die nur zufällig im Web existieren.

Was dieses Tool abdeckt und wo es aufhört

Fünf binäre Signale. Eine Frage: Kann ein automatisiertes System strukturierte Daten aus dieser Quelle extrahieren?

Das ist ein Pre-Flight-Check. Inhaltsqualität, faktische Korrektheit und Aktualität sitzen auf einer höheren Ebene. Diese Ebene liegt unter allen von ihnen. Wenn eine Domain hier scheitert, verbrennt Ihre Pipeline Tokens bei der Extraktion und bekommt Rauschen zurück.

Mein vollständiger Scanner deckt 183 Signale über 21 Audit-Cluster ab: Inhaltsqualität, Machine Provisioning, Infrastruktur-Härtung, Autoritätsindikatoren und Verankerung. Das Pre-Flight-Tool deckt 5 dieser 183 ab. Es sagt Ihnen, ob die Tür offen ist. Was dahinter liegt, erfordert den vollständigen Scan.

Ausführen

Das Tool ist eine einzelne Python-Datei mit einer Abhängigkeit (requests). Es akzeptiert einzelne Domains, mehrere Domains auf der Kommandozeile oder eine Datei mit einer Domain pro Zeile. Die Ausgabe geht ins Terminal, in eine CSV- oder eine JSON-Datei.

/// Verwendung
# Einzelne Domain
python infra-check.py example.com

# Batch mit CSV-Export
python infra-check.py --file domains.txt --csv results.csv

# JSON-Export für Pipeline-Integration
python infra-check.py --file domains.txt --json-out results.json

# Quiet-Modus (nur Urteilszeilen)
python infra-check.py --file domains.txt -q --csv results.csv

Der User-Agent-String identifiziert sich ehrlich als InfraCheck/1.0. Das Skript wartet 1 Sekunde zwischen den Domains, folgt Redirects und respektiert ein Timeout von 15 Sekunden.

Beispielausgabe

/// Terminal-Ausgabe
Checking 3 domain(s)...

❌  example-bank.de  [FAIL]  (2/5 checks passed)
   JSON-LD:     missing
   llms.txt:    missing
   robots.txt:  open
   Headers:     HTTP 200, security headers: yes
   SSL/TLS:     valid

✅  example-saas.com  [PASS]  (4/5 checks passed)
   JSON-LD:     valid (Organization, WebSite)
   llms.txt:    found (2340 bytes)
   robots.txt:  open, blocks 2 AI bots
   Headers:     HTTP 200, security headers: yes
   SSL/TLS:     valid

❌  example-gov.de  [FAIL]  (1/5 checks passed)
   JSON-LD:     missing
   llms.txt:    missing
   robots.txt:  blocks all bots
   Headers:     HTTP 200, security headers: incomplete
   SSL/TLS:     valid

==================================================
Total: 3 | Passed: 1 | Failed: 2

Was ich aus dem Betrieb im großen Maßstab gelernt habe

Ich habe den vollständigen Batch zweimal laufen lassen: Juni 2026 und August 2026. Der Composite-Score über alle 559 Domains fiel von 45,3 auf 44,0. Das Web wurde in zwei Monaten schlechter für Maschinen.

Die fünf Pre-Flight-Signale bilden diesen Rückgang ab. Domains, die im Juni 4 oder 5 Prüfungen bestanden, bestehen jetzt 3. Das Muster konzentriert sich auf Behördenportale und Automotive. B2B-E-Commerce bewegte sich in die entgegengesetzte Richtung: die einzige Branchenliste, die sich verbesserte.

Das Pre-Flight-Tool gibt Ihnen die binäre Antwort schnell. Wenn Sie das vollständige Bild brauchen, mit gewichteten Scores, Branchen-Benchmarks und signierten Attestierungen, dann ist es genau das, wofür ich SOVP gebaut habe.

Den Code holen

Die vollständige infra-check.py mit CLI-Argument-Parsing, CSV/JSON-Export, Batch-Verarbeitung und Deduplizierung:

👉 github.com/litzki-systems/infra-check

MIT-Lizenz. Eine Datei. Keine Konfiguration.

Eine Frage

Sie speisen Domains in Ihre Pipeline. Wie viele davon bestehen alle fünf Prüfungen?

Führen Sie das Skript aus. Sehen Sie sich die CSV an. Diese Zahl ist die tatsächliche Größe Ihrer nutzbaren Quellenliste.

Porträt von Thorsten Litzki, Agentic Architect bei Litzki Systems LLC
Thorsten Litzki Agentic Architect /// Litzki Systems LLC

Entwickelt deterministische Validierungsarchitekturen für Deep Tech und B2B SaaS. Als Architekt des Sovereign Validation Protocol (SOVP) etabliert er Signalsouveränität auf Protokollebene, um maschinelle Lesbarkeit über autonome Agentensysteme hinweg zu garantieren.