Dokumentinhalt abrufen

Dokument‑Objekt abrufen 1. Dokument‑Objekt erstellen 2. Zwei Lademöglichkeiten 1)HTML‑String laden 2)Lokale HTML‑Datei laden (Kodierung festlegen, um Zeichenfehler zu vermeiden) Bei Windows‑Pfaden empfehlt sich das Zeichen @ zum Deaktivieren der Escape‑Verarbeitung. …

Anwendungsfall

I. Umgebung einrichten 1. Referenzierung Zwei gängige Vorgehensweisen: 2. Wichtige Kernklassen Klassenname Beschreibung HtmlDocument HTML‑Dokumentcontainer, lädt den HTML‑Quelltext HtmlWeb Klasse für Netzwerkanfragen, holt HTML‑Inhalt direkt von einer URL HtmlNode Einzelner …

XPath

1. Was ist XPath XPath (XML Path Language) ist eine Pfadsprache für XML. Aufgabe:Mit Pfadausdrücken werden Knoten, Knotentexte und Knotenattribute in XML/HTML‑Dokumenten abgefragt, bedingte Filterung ist möglich. Wichtiger Hinweis: HtmlAgilityPack …

Einführung

Der offizielle Quellcode liegt heute auf GitHub:https://github.com/zzzprojects/html-agility-pack Html Agility Pack ist eine der bekanntesten Open‑Source‑Bibliotheken für HTML‑Parsing im .NET‑Ökosystem. Sie ist in C# geschrieben und wird häufig für Web‑Scraping, HTML‑Inhaltsextraktion …