doc-scraper: Ga crawler die lokale documentatiecontext voor LLM's opbouwt
doc-scraper, door Sriram PR, verzamelt technische website documentatie en bereidt deze voor op AI-ondersteunde workflows. De app doorzoekt documentatiesites en extraheert leesbare inhoud die geoptimaliseerd is voor gebruik als modelcontext, gericht op ontwikkelaars en AI-onderzoekers. Het benadrukt schone, doorzoekbare output en een lokale kennisopslag zodat op editor gebaseerde assistenten relevante referentiematerialen kunnen raadplegen zonder rommelige webpagina's te trekken tijdens het opstellen van prompts.
Converteert site HTML naar gestructureerde Markdown geschikt voor modelcontext
De tool is een op Go gebaseerde crawler die documentatie HTML omzet in gestructureerde Markdown, waarbij navigatiebalken, voetteksten en andere niet-inhoudelijke elementen worden verwijderd. De conversie behoudt koppen en inline code terwijl het tekstuele ruis vermindert, wat compacte corpusbestanden oplevert die de navigatiecontext behouden via schone koppen en links voor eenvoudigere terugvinding en referentie door downstream modelwerkstromen.
Doorzoekbaarheid en wijzigingsdetectie maken het corpus betrouwbaar voor agenten
De app embed een offline BM25 zoekfunctie geïmplementeerd via SQLite FTS5, waarmee lokale zoekopdrachten tegen het gecrawlde corpus mogelijk zijn zonder internettoegang. Statuspersistentie met BadgerDB en SQLite ondersteunt hervatbare operaties en een geschiedenisindex. Een inhoudsgevoelige diff-mechanisme identificeert daadwerkelijke paginawijzigingen in plaats van uitsluitend op tijdstempels te vertrouwen, wat overbodige downloads vermindert en het lokale corpus gefocust houdt op substantiële bewerkingen.
Invoerpaterns en crawl-limieten definiëren waar het succesvol is
doc-scraper detecteert automatisch documentatie-frameworks zoals Docusaurus, MkDocs, Sphinx, GitBook en ReadTheDocs, en gebruikt een op leesbaarheid gebaseerde extractor op onbekende sites. Crawlen gebeurt parallel met gedeeld resourcebeheer en ingebouwde snelheidsbeperkingen, en de crawler respecteert robots.txt om beleefd te blijven. Die grenzen prioriteren het extraheren van ontwikkelaarsrelevante inhoud terwijl overmatige netwerkbelasting wordt vermeden.
Lokale MCP-hosting past bij editor-gecentreerde AI-werkstromen en privacybehoeften
Wanneer uitgevoerd in servermodus, fungeert de app als een Model Context Protocol-server zodat lokale AI-agenten documentatie kunnen lezen en doorzoeken binnen editors. Het lokale, offline kennisbasisontwerp houdt doorzoekbare documentatie beschikbaar voor agenten zoals Claude Desktop, Claude Code en Cursor, waardoor de afhankelijkheid van externe terugvinding wordt verminderd. De tool wordt opgemerkt in Go en AI-ontwikkelaarsgemeenschappen voor het produceren van schone output op sites waar andere scrapers moeite mee hebben.
Het beste geschikt voor technisch onderlegde ontwikkelaars die lokale context kunnen bouwen en hosten
doc-scraper is een praktische optie voor ontwikkelaars en onderzoekers die verifieerbare, lokaal gehoste documentatie nodig hebben als modelcontext. Omdat de tool vereist dat deze vanuit de bron wordt gebouwd met Go (versie 1.25 of later), geeft het de voorkeur aan technisch capabele gebruikers; teams die Go-projecten niet kunnen compileren, moeten rekening houden met opstartkosten. Gebruikers moeten gescrapete passages inspecteren voordat ze deze als gezaghebbende modelinvoer gebruiken.





