끄적끄적
웹 스파이더링(or 크롤링) - (2) 본문
※ 무분별하게 또는 악의적으로 사용하게 되면 법적 처벌을 받을 수 있습니다. 함부로 사용하지 마세요.
웹 크롤러(web crawler)
- 조직적, 자동화된 방법으로 월드 와이드 웹을 탐색하는 컴퓨터 프로그램
- 앤트(ants), 자동 인덱서(automatic indexers), 봇(bots), 웜(worms), 웹 스파이더(web spider), 웹 로봇(web robot)
웹 크롤링(web crawling) 혹은 스파이더링(spidering)
- 웹 크롤러가 하는 작업
- 검색 엔진과 같은 여러 사이트에서는 데이터의 최신 상태 유지를 위해 사용( ex: googlebot, nhnbot )
- 방문한 사이트의 모든 페이지의 복사본을 생성하는 데 사용
- 검색 엔진은 이렇게 생성된 페이지를 보다 빠른 검색을 위해 인덱싱한다.
- 링크 체크나 HTML 코드 검증과 같은 웹 사이트의 자동 유지 관리 작업을 위해 사용
- 자동 이메일 수집과 같은 웹 페이지의 특정 형태의 정보를 수집하는 데도 사용( 스팸 메일 보내는 사람들이 주로 사용함 )
- 크롤링 한 정보를 스캐너에게 보내어 취약점 분석하는 등의 공격에 사용될 수도 있다.
Burp Suite를 이용한 웹 스파이더링
1. 이전에 배웠던 Burp Suite를 이용한 패킷 가로채기를 실시한다. (참고 Burp Suite & Proxy SwitchyOmega )
2. 이 패킷 정보를 오른쪽 단추를 누른 후 "Send to Spider"를 선택
3. Target - Site map 탭에 들어가보면 현재 가로챈 패킷의 사이트가 추가 되어 있다.
- 아래에 보면 내가 가로챈 패킷의 사이트가 아닌 구글이나 다른 곳도 자동으로 추가 된다.
- 하지만 자동으로 크롤링이 되는 건 아님.
4. 이후에 크롤링 하고자 하는 사이트를 우클릭 후 "Add to scope"를 선택
5. Spider - Options 탭에서 여러가지 설정을 할 수 있는데 중요한 건 총 4가지
1) Check robots.txt - 일부 웹 사이트 같은 경우 검색 엔진에 인덱싱 되지 않도록 robot.txt에 설정해놓은 경우가 있는데 이 옵션을 켜면 robot.txt에 있는 링크들도 확인할 수 있다고 한다
2) 새로운 링크와 콘텐츠를 Passive / Active 두가지로 scanning 설정 가능
3) 자동으로 text field 에 assign 하고 submit 해줌
4) default는 Prompt for guidance
- 로그인을 해야하는 경우 자동으로 아이디 패스워드를 submit 하도록 함
6. 스파이더링을 시작하려면 웹 어플리케이션을 우클릭 후 "Spider this branch" 를 클릭
7. 스파이더링이 완료되면 해당 사이트의 url 정보 status code, 문서 타입, 길이, path, file 등등을 확인 할 수 있다.
'해킹' 카테고리의 다른 글
| XSS ( Cross Site Scripting ) (0) | 2016.02.26 |
|---|---|
| 웹 해킹 기본 (0) | 2016.02.26 |
| 웹 스캐너 - (3) (0) | 2016.02.20 |
| Jmeter Source IP 변경하여 테스트 (0) | 2016.01.31 |
| Burp Suite & Proxy SwitchyOmega (0) | 2016.01.23 |