목록beautifulsoap (1)
IT is Smart
텍스트마이닝의 첫단계, 웹크롤링
☆★♡♥블로그 방문자분들께 책 선물 드려요!☆★♡♥ 텍스트 마이닝이란 탄광에서 광물을 캐어내 듯이 사람들이 자연스럽게 만들어낸 문장에서 의미있는 정보를 찾아내는 작업을 말합니다. 광물이 많이 포함되어 있는 지역에서 원석들을 캐어내어야 정제를 하더라도 필요한 광물을 더 많이 얻어낼 수 있겠죠. 텍스트 마이닝도 마찬가지입니다. 필요한 정보가 있는 곳(웹사이트)를 찾아서 그 중에서도 내가 얻어내고자 하는 정보가 포함되어 있는 문서(웹페이지)를 수집하는 것이 가장 먼저 해야 할 일입니다. 파이썬을 이용해서 손쉽게 인터넷 상의 정보를 수집하는 기본적인 방법을 알아보겠습니다. urllib와 BeautifulSoap4를 활용해서 아주 심플하게 예제를 만들어보겠습니다. urllib는 인터넷에서 웹 상의 문서, 이미지 ..
Programming/Text Mining
2016. 8. 28. 15:57