doc-scraper: Vai crawler che costruisce un contesto di documentazione locale per LLMs
doc-scraper, di Sriram PR, raccoglie documentazione tecnica dei siti web e la prepara per flussi di lavoro assistiti dall'IA. L'app esegue la scansione dei siti di documentazione ed estrae contenuti leggibili ottimizzati per l'uso come contesto per i modelli, rivolgendosi a sviluppatori e ricercatori di IA. Sottolinea un output pulito e ricercabile e un archivio di conoscenze locale in modo che gli assistenti basati su editor possano accedere a materiale di riferimento pertinente senza dover estrarre pagine web rumorose durante la costruzione dei prompt.
Converte l'HTML del sito in Markdown strutturato adatto per il contesto del modello
Lo strumento è un crawler basato su Go che converte l'HTML della documentazione in Markdown strutturato, rimuovendo barre di navigazione, piè di pagina e altri elementi non contenutistici. La conversione preserva intestazioni e codice inline mentre riduce il rumore testuale, producendo file di corpus compatti che mantengono il contesto di navigazione tramite intestazioni e link puliti per un recupero e riferimento più facili da parte dei flussi di lavoro del modello a valle.
Ricercabilità e rilevamento delle modifiche rendono il corpus affidabile per gli agenti
L'app incorpora una ricerca offline BM25 implementata tramite SQLite FTS5, consentendo query locali contro il corpus crawled senza accesso a Internet. La persistenza dello stato con BadgerDB e SQLite supporta operazioni riprendibili e un indice di storia. Un meccanismo di differenza consapevole del contenuto identifica le reali modifiche della pagina invece di fare affidamento esclusivamente sui timestamp, riducendo i download ridondanti e mantenendo il corpus locale concentrato su modifiche sostanziali.
I modelli di input e i limiti di crawling definiscono dove ha successo
doc-scraper rileva automaticamente framework di documentazione come Docusaurus, MkDocs, Sphinx, GitBook e ReadTheDocs, e utilizza un estrattore basato sulla leggibilità su siti non familiari. Il crawling avviene in parallelo con gestione delle risorse condivise e limitazione della velocità integrata, e il crawler rispetta robots.txt per rimanere educato. Questi confini danno priorità all'estrazione di contenuti rilevanti per gli sviluppatori evitando un carico eccessivo sulla rete.
Hosting locale MCP si adatta ai flussi di lavoro AI centrati sull'editor e alle esigenze di privacy
Quando eseguito in modalità server, l'app funge da server del Protocollo di Contesto del Modello in modo che gli agenti AI locali possano leggere e cercare documentazione all'interno degli editor. Il design della base di conoscenza locale e offline mantiene la documentazione ricercabile disponibile per agenti come Claude Desktop, Claude Code e Cursor, riducendo la dipendenza dal recupero remoto. Lo strumento è noto nelle comunità di sviluppatori Go e AI per produrre output pulito su siti con cui altri scraper faticano.
Più adatto a sviluppatori tecnicamente competenti che possono costruire e ospitare contesto locale
doc-scraper è un'opzione pratica per sviluppatori e ricercatori che necessitano di documentazione verificabile, ospitata localmente come contesto modello. Poiché lo strumento richiede di essere costruito da sorgente con Go (versione 1.25 o successiva), favorisce utenti tecnicamente capaci; i team che non possono compilare progetti Go dovrebbero aspettarsi un sovraccarico di configurazione. Gli utenti dovrebbero ispezionare i passaggi estratti prima di usarli come input modello autorevoli.





