Download gratis per MCP

Guarda un annuncio per scaricare gratuitamente

Recensione Softonic

doc-scraper: Vai crawler che costruisce un contesto di documentazione locale per LLMs

doc-scraper, di Sriram PR, raccoglie documentazione tecnica dei siti web e la prepara per flussi di lavoro assistiti dall'IA. L'app esegue la scansione dei siti di documentazione ed estrae contenuti leggibili ottimizzati per l'uso come contesto per i modelli, rivolgendosi a sviluppatori e ricercatori di IA. Sottolinea un output pulito e ricercabile e un archivio di conoscenze locale in modo che gli assistenti basati su editor possano accedere a materiale di riferimento pertinente senza dover estrarre pagine web rumorose durante la costruzione dei prompt.

Converte l'HTML del sito in Markdown strutturato adatto per il contesto del modello

Lo strumento è un crawler basato su Go che converte l'HTML della documentazione in Markdown strutturato, rimuovendo barre di navigazione, piè di pagina e altri elementi non contenutistici. La conversione preserva intestazioni e codice inline mentre riduce il rumore testuale, producendo file di corpus compatti che mantengono il contesto di navigazione tramite intestazioni e link puliti per un recupero e riferimento più facili da parte dei flussi di lavoro del modello a valle.

Ricercabilità e rilevamento delle modifiche rendono il corpus affidabile per gli agenti

L'app incorpora una ricerca offline BM25 implementata tramite SQLite FTS5, consentendo query locali contro il corpus crawled senza accesso a Internet. La persistenza dello stato con BadgerDB e SQLite supporta operazioni riprendibili e un indice di storia. Un meccanismo di differenza consapevole del contenuto identifica le reali modifiche della pagina invece di fare affidamento esclusivamente sui timestamp, riducendo i download ridondanti e mantenendo il corpus locale concentrato su modifiche sostanziali.

I modelli di input e i limiti di crawling definiscono dove ha successo

doc-scraper rileva automaticamente framework di documentazione come Docusaurus, MkDocs, Sphinx, GitBook e ReadTheDocs, e utilizza un estrattore basato sulla leggibilità su siti non familiari. Il crawling avviene in parallelo con gestione delle risorse condivise e limitazione della velocità integrata, e il crawler rispetta robots.txt per rimanere educato. Questi confini danno priorità all'estrazione di contenuti rilevanti per gli sviluppatori evitando un carico eccessivo sulla rete.

Hosting locale MCP si adatta ai flussi di lavoro AI centrati sull'editor e alle esigenze di privacy

Quando eseguito in modalità server, l'app funge da server del Protocollo di Contesto del Modello in modo che gli agenti AI locali possano leggere e cercare documentazione all'interno degli editor. Il design della base di conoscenza locale e offline mantiene la documentazione ricercabile disponibile per agenti come Claude Desktop, Claude Code e Cursor, riducendo la dipendenza dal recupero remoto. Lo strumento è noto nelle comunità di sviluppatori Go e AI per produrre output pulito su siti con cui altri scraper faticano.

Più adatto a sviluppatori tecnicamente competenti che possono costruire e ospitare contesto locale

doc-scraper è un'opzione pratica per sviluppatori e ricercatori che necessitano di documentazione verificabile, ospitata localmente come contesto modello. Poiché lo strumento richiede di essere costruito da sorgente con Go (versione 1.25 o successiva), favorisce utenti tecnicamente capaci; i team che non possono compilare progetti Go dovrebbero aspettarsi un sovraccarico di configurazione. Gli utenti dovrebbero ispezionare i passaggi estratti prima di usarli come input modello autorevoli.

  • Pro

    • Converte la documentazione HTML in Markdown pulito e strutturato per il contesto del modello
    • La ricerca offline BM25 tramite SQLite FTS5 consente interrogazioni locali senza internet
    • Il crawling incrementale e il diff consapevole del contenuto riducono i recuperi di pagina ridondanti
    • Agisce come un server del Protocollo di Contesto del Modello per l'integrazione dell'editor
  • Contro

    • Richiede la compilazione dal sorgente con Go 1.25 o successivo
    • Il fallback basato sulla leggibilità potrebbe perdere metadati strutturati su siti non standard
    • La cortesia e il rate limiting possono estendere i tempi di scansione di grandi corpus
 0/1

Dettagli dell'app

  • Autore

  • Licenza

    Gratis

  • Versione

    v2.9.2

  • Data di aggiornamento

  • Piattaforme

    MCP

  • Lingua

    Inglese

Il programma è disponibile in altre lingue


Download gratis per MCP

Guarda un annuncio per scaricare gratuitamente


Opinioni utenti su doc-scraper

Hai provato doc-scraper? Puoi essere il primo a lasciare la tua opinione!

Aggiungi recensione

Ultimi articoli

La legislazione relativa all’utilizzo di questo software è competenza dei singoli Stati. Non autorizziamo, né giustifichiamo in nessun modo un uso illecito di questo programma qualora infringa tali leggi.
Accesso a Softonic effettuato come