끄적끄적

웹 스파이더링(or 크롤링) - (2) 본문

해킹

웹 스파이더링(or 크롤링) - (2)

widruv 2016. 2. 5. 20:36

※ 무분별하게 또는 악의적으로 사용하게 되면 법적 처벌을 받을 수 있습니다. 함부로 사용하지 마세요. 


웹 크롤러(web crawler)

 - 조직적, 자동화된 방법으로 월드 와이드 웹을 탐색하는 컴퓨터 프로그램

 - 앤트(ants), 자동 인덱서(automatic indexers), 봇(bots), 웜(worms), 웹 스파이더(web spider), 웹 로봇(web robot)


웹 크롤링(web crawling) 혹은 스파이더링(spidering)

 - 웹 크롤러가 하는 작업

 - 검색 엔진과 같은 여러 사이트에서는 데이터의 최신 상태 유지를 위해 사용( ex: googlebot, nhnbot )

 - 방문한 사이트의 모든 페이지의 복사본을 생성하는 데 사용

 - 검색 엔진은 이렇게 생성된 페이지를 보다 빠른 검색을 위해 인덱싱한다. 

 - 링크 체크나 HTML 코드 검증과 같은 웹 사이트의 자동 유지 관리 작업을 위해 사용

 - 자동 이메일 수집과 같은 웹 페이지의 특정 형태의 정보를 수집하는 데도 사용( 스팸 메일 보내는 사람들이 주로 사용함 )

 - 크롤링 한 정보를 스캐너에게 보내어 취약점 분석하는 등의 공격에 사용될 수도 있다.





Burp Suite를 이용한 웹 스파이더링


1. 이전에 배웠던 Burp Suite를 이용한 패킷 가로채기를 실시한다. (참고 Burp Suite & Proxy SwitchyOmega )

2. 이 패킷 정보를 오른쪽 단추를 누른 후 "Send to Spider"를 선택



3. Target - Site map 탭에 들어가보면 현재 가로챈 패킷의 사이트가 추가 되어 있다.

 - 아래에 보면 내가 가로챈 패킷의 사이트가 아닌 구글이나 다른 곳도 자동으로 추가 된다. 

 - 하지만 자동으로 크롤링이 되는 건 아님.

4. 이후에 크롤링 하고자 하는 사이트를 우클릭 후 "Add to scope"를 선택



5. Spider - Options 탭에서 여러가지 설정을 할 수 있는데 중요한 건 총 4가지

 1) Check robots.txt - 일부 웹 사이트 같은 경우 검색 엔진에 인덱싱 되지 않도록 robot.txt에 설정해놓은 경우가 있는데 이 옵션을 켜면 robot.txt에 있는 링크들도 확인할 수 있다고 한다

 2) 새로운 링크와 콘텐츠를 Passive / Active 두가지로 scanning 설정 가능

 3) 자동으로 text field 에 assign 하고 submit 해줌



4) default는 Prompt for guidance

 - 로그인을 해야하는 경우 자동으로 아이디 패스워드를 submit 하도록 함



6. 스파이더링을 시작하려면 웹 어플리케이션을 우클릭 후 "Spider this branch" 를 클릭


7. 스파이더링이 완료되면 해당 사이트의 url 정보 status code, 문서 타입, 길이, path, file 등등을 확인 할 수 있다.


'해킹' 카테고리의 다른 글

XSS ( Cross Site Scripting )  (0) 2016.02.26
웹 해킹 기본  (0) 2016.02.26
웹 스캐너 - (3)  (0) 2016.02.20
Jmeter Source IP 변경하여 테스트  (0) 2016.01.31
Burp Suite & Proxy SwitchyOmega  (0) 2016.01.23
Comments