K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

Sparkfetch/sparkfetch

45TypeScriptMIT

一个把杂乱网页转换成干净文本、方便AI直接读取的开源接口

SparkFetch只需输入一个网址,就能去掉广告、导航栏等无关内容,把网页整理成干净的Markdown、纯文本或结构化JSON格式返回。它不仅能抓取单个页面,还能按设定深度自动爬取整个网站,或者快速列出某个域名下的所有链接。项目用TypeScript编写,基于Node.js和Express构建,开源代码可以自己部署运行。

它做什么

  1. 不是直接返回原始HTML,而是去掉广告、导航等无用内容,输出Markdown、纯文本或JSON格式
  2. scrape接口抓取单个页面,crawl接口顺着链接批量抓取多个页面,map接口只快速列出域名下的所有网址
  3. 返回结果中除了正文内容,还带有标题、描述、状态码等附加信息
  4. 用TypeScript编写,运行在Node.js 24和Express 5上,任何人都可以下载后部署在自己的服务器上

为什么重要

给AI聊天机器人或搜索工具提供最新网页信息时,需要的是整理干净的文本而不是原始网页,这个项目省去了自己开发这套清洗逻辑的工作。开源意味着团队可以自行部署,不必把数据发送给第三方服务。

本仓库术语

  • Markdown · 用简单符号标记标题、列表等格式的轻量文本格式
  • 爬取(Crawl) · 顺着页面中的链接自动访问并收集多个页面的操作
  • RAG流程 · AI在生成回答前先检索外部文档作为参考的处理流程
  • 元数据(metadata) · 除正文外描述内容的附加信息,如标题、描述、抓取时间

仓库简介(英文)

🔥 Turn any URL into clean, structured, LLM-ready content. The open-source web fetching & extraction API.

在 GitHub 打开

热门仓库

全部仓库 →

METAL MEDIA 最新报道