Selbstgehosteter MCP-Fetcher für Agent-Webforschung und -Extraktion
master-fetch, von Dondai1234, ist ein Model Context Protocol-Server, der KI-Agenten lokalen Zugriff auf aktuelle Webinhalte für Modellkontext und Forschung ermöglicht. Es ruft Seiten ab und gibt bereinigten Text und Suchergebnisse zurück, während es JavaScript-intensive Seiten und Anti-Bot-Wände behandelt. Die App hebt die Null-Konfiguration, den schlüssellosen Betrieb und die Dokumentenverarbeitung auf dem Gerät hervor. Entwickler und KI-Power-User erhalten eine private, selbstgehostete Abrufpipeline für Lokalisierung, Dokumentationsaufnahme und agentengesteuerte Forschungsworkflows.
Welche Aufgaben können Sie tatsächlich dafür verwenden?
master-fetch dient als Abrufmaschine, die lesbares Quellmaterial für nachgelagerte Modelle bereitstellt, mit Fokus auf ai-text-localization und Forschungsaufgaben. Typische Ergebnisse umfassen das Extrahieren von Dokumentationen zur Übersetzung, das Scrapen von Webseiten nach lokalisierten Strings und das Mapping von Site-Inhalten für Modellaufforderungen. Praktische Aufgabentypen:
- Holen und Bereinigen von HTML für Modelleinträge
- Seitenweites Crawlen über Sitemaps
- Konvertieren von PDFs und Bildern in Text zur Verarbeitung
Wie zuverlässig und sauber sind die abgerufenen Ausgaben?
Das Tool produziert bereinigten, modellbereiten Text, indem es Trafilatura und lxml verwendet, um Werbung und Boilerplate zu entfernen, und es kann Markdown oder reinen Text ausgeben, der für den Kontext von Aufforderungen geeignet ist. Für bildlastige Dokumente wird eine lokale ONNX-basierte OCR-Pipeline angewendet, um Zeichen zu extrahieren. Das Projekt umfasst auch einen lokalen neuronalen Neurankierungsschritt, der die Suchergebnisse neu anordnet, was hilft, die relevantesten abgerufenen Seiten für die Agentennutzung zu priorisieren.
Welche Eingaben und operationale Grenzen sollten Sie erwarten?
Akzeptierte Eingaben umfassen URLs, Site-Sitemaps für tiefes Crawlen und hochgeladene PDFs oder Bilder für OCR. Die Installation erfordert eine Python 3.10+-Umgebung und das Paket (pip install hound-mcp), und das Stealth-Abrufen kann optional einen lokalen Chrome- oder Chromium-Binary verwenden. Der Server integriert sich mit MCP-Hosts wie Claude Desktop, Cursor und OpenCode, und seine Suche funktioniert ohne externe API-Schlüssel, indem sie sich auf lokales Scraping und Routing-Logik stützt.
Passt es in Entwickler-Workflows ohne großen Overhead?
Das Design richtet sich an Entwickler und KI-Power-User, die einen MCP-Endpunkt selbst hosten und in Agenten-Stacks integrieren können. Der Entwickler implementierte eine automatische Eskalation zwischen HTTP-, Browser-Rendering- und Stealth-Modi, um erfolgreiche Abrufe von geschützten Seiten zu erhöhen, und die Community hebt die Stärken der automatischen Eskalation hervor. Da der Dienst vollständig lokal läuft, können Teams, die Datenhoheit priorisieren, ihn in bestehende interne Pipelines zur Generierung von Modellkontexten integrieren.
Wer sollte es übernehmen und wer sollte woanders suchen
master-fetch ist eine entwicklerorientierte Wahl für Teams, die agentengesteuerte Forschung oder Lokalisierungspipelines aufbauen und einen selbstgehosteten Server betreiben können. Es eignet sich für Gruppen, die Kontrolle über die abgerufenen Materialien priorisieren und einen auf Python basierenden Dienst aufrechterhalten können. Organisationen ohne interne Ingenieurskapazitäten oder solche, die einen verwalteten, schlüsselfertigen Scraping-Dienst bevorzugen, sollten Alternativen in Betracht ziehen, die die Hosting-Verantwortung entfernen.





