Connection check
verified live · 28h ago
web-4
Web scraping to clean Markdown with JS rendering, multi-page crawl, structured extract, sitemaps.
Tools
4
GitHub stars
—
Installs / wk
—
Licence
—
Transport
streamable-http
Last checked
28h ago
Tools & capabilities
4 toolsRead from the running server on 28h ago.
crawl
max_depthmax_pagesstart_url*same_domain
从入口 URL 广度优先抓取多页,每页转干净 Markdown(按实际抓取页数计费,每页 1 credit)。 纯抓取 + 格式转换,不生成任何 AI 内容;逐页 SSRF 校验,单页失败不中断。 从入口 URL 广度优先抓取多页,每页转干净 Markdown(按实际抓取页数计费,每页 1 credit)。 纯抓取 + 格式转换,不生成任何 AI 内容;逐页 SSRF 校验,单页失败不中断。
extract
url*targetsselectors
结构化抽取网页要素(表格/链接/图片/标题大纲/元数据/自定义 CSS 选择器),返回 JSON。 与 scrape_url 的区别:不返回整页正文,只返回指定结构——表格转成 headers+rows 的 JSON 可直接计算;配自定义选择器可精准取价格/标题等字段。 结构化抽取网页要素(表格/链接/图片/标题大纲/元数据/自定义 CSS 选择器),返回 JSON。 与 scrape_url 的区别:不返回整页正文,只返回指定结构——表格转成 headers+rows 的 JSON 可直接计算;配自定义选择器可精准取价格/标题等字段。
scrape_url
url*renderformatsonly_main_content
抓取一个公开网页,返回干净的 Markdown(供 AI 阅读/总结/提取)。 只抓公开网页,禁止内网/保留地址;不生成任何内容,只做抓取与格式转换。 静态抓取拿不到内容的 JS 动态页可加 render=true 走真浏览器渲染。 抓取一个公开网页,返回干净的 Markdown(供 AI 阅读/总结/提取)。 只抓公开网页,禁止内网/保留地址;不生成任何内容,只做抓取与格式转换。 静态抓取拿不到内容的 JS 动态页可加 render=true 走真浏览器渲染。
site_map
url*max_urls