목록urllib (3)
IT is Smart
이번에는 인터넷에서 구할 수 있는 데이터 자료를 수집하는 방법에 대해서 알아보겠습니다.여기서 설명하는 것은 하나의 사례로써 이외에도 다양한 다른 방법이 있습니다. 내용을 참조하신 후 적절한 상황에 활용하시기 바랍니다. 인터넷으로 쉽게 구할 수 있는 데이터로는 주가 정보가 있습니다. yahoo의 finance섹션에서는 특정기업의 주가정보를 csv파일로도 제공을 해주고 있는데 이 자료를 수집하는 사례를 알아보겠습니다. 아래와 같이 Yahoo의 Finance 섹션에 접속한 후 특정기업을 검색합니다. 아래의 경우는 Microsoft를 검색해 봤습니다. 중간에 있는 베너 바로 위를 보면 Summary, Statistics, Profile, Financials, Options, Holders, Historical ..
☆★♡♥블로그 방문자분들께 책 선물 드려요!☆★♡♥ 이번에는 인터넷 상의 이미지를 읽어와서 내 로컬컴퓨터에 저장하는 방법을 알아보겠습니다.브라우저로 검색해서 저장하기 할 수도 있지만 수집하려는 이미지가 많은 경우에는 하나하나 저장하는 것보다 자동으로 처리해주면 엄청나게 수월해지겠지요. import random import urllib.request def download_img(url): name = random.randrange(1, 1000) full_name = str(name) + ".jpg" urllib.request.urlretrieve(url, full_name) download_img("http://cfs.tistory.com/custom/blog/188/1888093/skin/previe..
☆★♡♥블로그 방문자분들께 책 선물 드려요!☆★♡♥ 텍스트 마이닝이란 탄광에서 광물을 캐어내 듯이 사람들이 자연스럽게 만들어낸 문장에서 의미있는 정보를 찾아내는 작업을 말합니다. 광물이 많이 포함되어 있는 지역에서 원석들을 캐어내어야 정제를 하더라도 필요한 광물을 더 많이 얻어낼 수 있겠죠. 텍스트 마이닝도 마찬가지입니다. 필요한 정보가 있는 곳(웹사이트)를 찾아서 그 중에서도 내가 얻어내고자 하는 정보가 포함되어 있는 문서(웹페이지)를 수집하는 것이 가장 먼저 해야 할 일입니다. 파이썬을 이용해서 손쉽게 인터넷 상의 정보를 수집하는 기본적인 방법을 알아보겠습니다. urllib와 BeautifulSoap4를 활용해서 아주 심플하게 예제를 만들어보겠습니다. urllib는 인터넷에서 웹 상의 문서, 이미지 ..