컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

SSDEVIL108/LLM-Guided-Crawler-Secret-Hunter

7Python

웹사이트를 자동으로 훑으며 개발자가 실수로 남긴 비밀 정보를 AI가 찾아주는 도구

이 저장소는 웹사이트를 재귀적으로 크롤링하면서 링크와 자바스크립트 파일을 정확히 뽑아낸 뒤, 그 코드를 여러 개의 LLM(거대언어모델)에 동시에 보내 보안 취약점 후보를 찾는 파이썬 도구다. 스테이징 서버 주소, 디버그 옵션, 숨겨진 API 경로 같은 것을 자동으로 찾아 마크다운 보고서로 실시간 저장한다. 버그바운티(취약점 신고 포상제)나 보안 감사를 하는 사람이 정찰 단계를 자동화하기 위해 만든 오픈소스 프로젝트다.

무엇을 하는 레포인가

  1. BeautifulSoup4라는 라이브러리로 웹페이지의 링크(a 태그)와 스크립트 주소(script 태그)를 있는 그대로 추출해, LLM이 없는 링크를 지어내는 문제를 원천 차단한다
  2. 추출된 코드 조각을 ThreadPoolExecutor로 여러 LLM(NVIDIA NIM 또는 OpenAI 호환 API)에 동시에 보내 보안 감사를 병렬로 수행한다
  3. 페이지, 스크립트, 링크, AI가 찾은 보안 이슈를 서로 연결한 지식 그래프를 메모리에 만들어 구조를 파악하기 쉽게 한다
  4. CSS나 이미지 같은 UI 관련 파일은 걸러내고 스테이징 서브도메인, DEBUG=true 같은 디버그 파라미터, /v1/* 같은 숨겨진 API 경로만 집중적으로 찾는다
  5. 스캔 결과를 마크다운 파일에 실시간으로 이어 쓰고, 중단되어도 기존 보고서를 읽어 이어서 스캔할 수 있다

왜 중요한가

보안 연구자나 버그바운티 참가자가 수동으로 하던 웹사이트 정찰과 코드 훑어보기 작업을 자동화해 시간을 크게 줄여줄 수 있다. 다만 LLM이 코드를 해석해 취약점 후보를 판단하는 만큼, 결과를 그대로 신뢰하기보다는 검증 도구로 활용하는 것이 적절하다.

이 레포의 용어

  • LLM · 거대언어모델. 텍스트나 코드를 이해하고 답을 생성하는 AI 모델
  • BeautifulSoup4 · HTML 문서를 분석해 원하는 태그나 정보를 뽑아내는 파이썬 라이브러리
  • ThreadPoolExecutor · 여러 작업을 동시에(병렬로) 처리할 수 있게 해주는 파이썬 기능
  • 지식 그래프 · 정보 조각들을 노드와 연결선으로 표현해 관계를 보여주는 데이터 구조
  • NVIDIA NIM · NVIDIA가 제공하는 AI 모델 실행 서비스 인터페이스

레포 원문 소개 (영문)

High-Precision Parallel Multi-Model LLM Web Reconnaissance Engine & Knowledge Graph Builder for Bug Bounty & Security Auditing.

GitHub에서 보기

주목받는 레포

레포 전체 보기 →

METAL MEDIA 최신 기사