K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

SSDEVIL108/LLM-Guided-Crawler-Secret-Hunter

7Python

一个自动爬网站、用AI帮你找开发者不小心泄露的秘密信息的工具

这是一个用Python写的工具,它会递归爬取目标网站,精确提取网页链接和JavaScript脚本文件路径,然后把这些代码同时发给多个大语言模型(LLM)并行分析,寻找安全隐患。它专门找预发布环境地址、调试参数、隐藏API接口这类容易被忽略的敏感信息,并把结果实时写入Markdown报告。这个项目是给做漏洞悬赏或安全审计的人自动化前期侦察工作用的。

它做什么

  1. 使用BeautifulSoup4库直接从HTML中提取真实存在的a标签链接和script标签脚本地址,避免LLM凭空编造不存在的链接
  2. 通过Python的ThreadPoolExecutor,把提取出的代码片段同时发送给多个LLM(NVIDIA NIM或兼容OpenAI接口的模型)并行审计
  3. 在内存中构建一个知识图谱,把页面、加载的脚本、外链和AI发现的安全问题相互连接起来
  4. 过滤掉CSS、图片等界面相关的噪音文件,专注寻找预发布子域名、DEBUG=true这类调试参数,以及/v1/*这样的隐藏API路径
  5. 扫描结果实时追加写入Markdown报告文件,即使中途中断,也能读取已有报告继续扫描,不用重新爬一遍

为什么重要

这能帮安全研究人员和漏洞悬赏参与者大幅减少手动翻查网站源代码、寻找内部信息泄露的时间。不过由于是LLM在解读代码并判断是否存在问题,结果更适合当作需要进一步核实的线索,而不是可以直接采信的结论。

本仓库术语

  • LLM · 大语言模型,一种能理解和生成文本或代码的AI模型
  • BeautifulSoup4 · 一个用于解析HTML、提取特定标签或信息的Python库
  • ThreadPoolExecutor · Python中用于并行执行多个任务的功能
  • 知识图谱 · 一种用节点和连线表示信息之间关系的数据结构
  • NVIDIA NIM · NVIDIA提供的一种运行AI模型的服务接口

仓库简介(英文)

High-Precision Parallel Multi-Model LLM Web Reconnaissance Engine & Knowledge Graph Builder for Bug Bounty & Security Auditing.

在 GitHub 打开

热门仓库

全部仓库 →

METAL MEDIA 最新报道