From 43414b546182ec64811c56848d50bf319a9de5da Mon Sep 17 00:00:00 2001 From: TatianaFilcheva <124861990+TatianaFilcheva@users.noreply.github.com> Date: Thu, 23 Mar 2023 08:36:57 +0300 Subject: [PATCH 01/34] Add files via upload --- Задания/task1/Filcheva/Verst1.py | 12 ++++++++++++ 1 file changed, 12 insertions(+) create mode 100644 Задания/task1/Filcheva/Verst1.py diff --git a/Задания/task1/Filcheva/Verst1.py b/Задания/task1/Filcheva/Verst1.py new file mode 100644 index 0000000..2000c61 --- /dev/null +++ b/Задания/task1/Filcheva/Verst1.py @@ -0,0 +1,12 @@ +from bs4 import BeautifulSoup +from selenium import webdriver +from selenium.webdriver.chrome.service import Service +from time import sleep +s = Service("C:\Driver\chromedriver.exe") +browser = webdriver.Chrome(service=s) +browser.get("https://mephi.ru/") +sleep(10) +html_text = browser.page_source +soup = BeautifulSoup(html_text, "lxml") +serv = soup.find_all("div", class_="views-field views-field-title menu-item menu-item-10702") +print(serv[0].text) From ae1517aed9961b7160025174ceb36a24bbc8f698 Mon Sep 17 00:00:00 2001 From: VladEpifanov <124862300+VladEpifanov@users.noreply.github.com> Date: Thu, 23 Mar 2023 11:09:37 +0300 Subject: [PATCH 02/34] Delete 1-sq.py --- Задания/task1/Epifanov/1-sq.py | 13 ------------- 1 file changed, 13 deletions(-) delete mode 100644 Задания/task1/Epifanov/1-sq.py diff --git a/Задания/task1/Epifanov/1-sq.py b/Задания/task1/Epifanov/1-sq.py deleted file mode 100644 index 7c3826a..0000000 --- a/Задания/task1/Epifanov/1-sq.py +++ /dev/null @@ -1,13 +0,0 @@ -from bs4 import BeautifulSoup -from selenium import webdriver -from selenium.webdriver.chrome.service import Service - -s = Service('C:\Desktop\exe\chromedriver.exe') -browser = webdriver.Chrome(service=s) -browser.get('https://www.rftoday.ru/_vse_zagolovki2') -html_text = browser.page_source -soup = BeautifulSoup(html_text, 'lxml') -infos = soup.find_all(attrs={"class": "title"}) -#print(infos[0].text) - если нужно вывести только n-ый заголовок -for info in infos: - print(info.text)#Вывод всех заголовков новостей страницы 1 From 0b288e4157942ab750318b32cfff15d67eccd992 Mon Sep 17 00:00:00 2001 From: VladEpifanov Date: Thu, 23 Mar 2023 11:10:52 +0300 Subject: [PATCH 03/34] =?UTF-8?q?=D0=9F=D0=B0=D1=80=D1=81=D0=B8=D0=BD?= =?UTF-8?q?=D0=B3=20=D1=81=D0=B0=D0=B9=D1=82=D0=B0(=D0=B4=D0=B7)?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- Задания/task1/Epifanov/1 - st hw.py | 14 ++++++++++++++ 1 file changed, 14 insertions(+) create mode 100644 Задания/task1/Epifanov/1 - st hw.py diff --git a/Задания/task1/Epifanov/1 - st hw.py b/Задания/task1/Epifanov/1 - st hw.py new file mode 100644 index 0000000..cb80d35 --- /dev/null +++ b/Задания/task1/Epifanov/1 - st hw.py @@ -0,0 +1,14 @@ +from bs4 import BeautifulSoup +from selenium import webdriver +from selenium.webdriver.chrome.service import Service + +s = Service('C:\Desktop\exe\chromedriver.exe') +browser = webdriver.Chrome(service=s) +browser.get('https://www.rftoday.ru/_vse_zagolovki2') +html_text = browser.page_source +soup = BeautifulSoup(html_text, 'lxml') +infos = soup.find_all(attrs={"class": "title"}) +revs = soup.find_all(attrs={"class": "source"}) +#print(infos[0].text) - если нужно вывести только n-ый заголовок +for info, rev in zip(infos, revs): + print(f"{info.text} ; Источник: {rev.text}")#Вывод всех заголовков новостей и их источников со страницы 1 \ No newline at end of file From fb8952c32fc3a14a4aabed04696c11ffd8e1d556 Mon Sep 17 00:00:00 2001 From: ada-dmitry <124861781+ada-dmitry@users.noreply.github.com> Date: Fri, 24 Mar 2023 10:02:15 +0300 Subject: [PATCH 04/34] Add files via upload --- Задания/task1/Antipenko/DB1.py | 42 ++++++++++++++++++++++++++++++++++ 1 file changed, 42 insertions(+) create mode 100644 Задания/task1/Antipenko/DB1.py diff --git a/Задания/task1/Antipenko/DB1.py b/Задания/task1/Antipenko/DB1.py new file mode 100644 index 0000000..b790f81 --- /dev/null +++ b/Задания/task1/Antipenko/DB1.py @@ -0,0 +1,42 @@ +import psycopg2 +import wget +from bs4 import BeautifulSoup +from selenium import webdriver +from selenium.webdriver.chrome.service import Service +# Парсер и загрузчик в БД//Антипенко Дмитрий +connection = psycopg2.connect(host='localhost', dbname='PythonDB', user='postgres', password='Q1w2e3r4') + +cursor = connection.cursor() + +creat_qwery = """ create table Parser + (id serial primary key, page_name varchar(100), price varchar(10), priceDis varchar(30), mark varchar(10), scr varchar(100))""" + +cursor.execute(creat_qwery) +connection.commit() + +driver = Service('D:\teach\Prog\chromedriver.exe') +browser = webdriver.Chrome(service=driver) +browser.get('https://amwine.ru/catalog/igristoe_vino_i_shampanskoe/igristoe_vino/') +html_code = browser.page_source +b_soup = BeautifulSoup(html_code, 'lxml') +name = b_soup.find_all('a', class_="catalog-list-item__title js-product-detail-link") +price = b_soup.find_all('span', class_="middle_price") +priceDis = b_soup.find_all('span', class_="baseoldprice") +mark = b_soup.find_all('span', class_="product-rating__rating") +pictures = b_soup.find_all('div', class_="catalog-list-item__img-wrapper") + +for i in range(15): + url = 'https://amwine.ru'+pictures[i].find('a').find('img').attrs['data-src'] + filename = f"Programming\\23.03\img\{i}.jpg" + print(filename) + wget.download(url, filename) + ins_qwery = f"""insert into public.Parser(page_name, price, priceDis, mark, scr) values ('{name[i].text}', '{price[i].text}', '{priceDis[i].text}', '{mark[i].text}', '{filename}')""" + cursor.execute(ins_qwery) + connection.commit() + + + + +cursor.close() + +connection.close() \ No newline at end of file From 145b614e59698fadc8e74b7b6ca3f92fe3071a63 Mon Sep 17 00:00:00 2001 From: pErfEcto2 Date: Fri, 24 Mar 2023 19:38:40 +0300 Subject: [PATCH 05/34] db connection added, image parsing added --- Задания/task1/Yaroshevskiy/main.py | 48 +++++++++++------------------- 1 file changed, 18 insertions(+), 30 deletions(-) diff --git a/Задания/task1/Yaroshevskiy/main.py b/Задания/task1/Yaroshevskiy/main.py index fae989b..945ddf8 100644 --- a/Задания/task1/Yaroshevskiy/main.py +++ b/Задания/task1/Yaroshevskiy/main.py @@ -1,40 +1,28 @@ -# установи python, pip - -# выполни эту команду: pip install selenium bs4 lxml -# если ты используешь pycharm, то надо библиотеки ставить не в консоли(терминале), а в самом pycharm -# для этого нажми "view" > "tool windows" > "python packages" -# внизу в окне поиска ищи нужные библиотеки -# когда найдешь, нажимай на нее, справа будет кнопка "install package", устанавливай, потом перезапусти pycharm - -# найди версию своего браузера -# напиши в гугле "скачать драйвер для <название и версия твоего браузера> selenium" -# теперь все готово для запуска этого -# помните, что сам сайт(который вы хотите парсить) может вас блокировать или заставлять проходить capture, из-за чего этот код ничего не выведет - from bs4 import BeautifulSoup from selenium import webdriver from selenium.webdriver.chrome.service import Service -# импортируем всё нужное +from wget import download +import psycopg2 as psyc -s = Service("путь_до_драйвера") # в ковычках указываем полный путь до скаченного ранее драйвера -# если ты на винде, то вместо знака "\" пиши "\\" -brow = webdriver.Chrome(service=s) # как будто создаем виртуальный браузер +brow = webdriver.Chrome() +url = "https://ikey.ru/" +brow.get(url) -brow.get("https://www.revshells.com/") # получаем html код сайта и другую информацию(она нам не нужна сейчас) +html = brow.page_source -html = brow.page_source # копируем html код в переменную +soup = BeautifulSoup(html, "lxml") -soup = BeautifulSoup(html, "lxml") # создаем специальный парсер +products = soup.find_all(attrs={"class": "product"}) -buttons = soup.find_all(attrs={"class": "list-group-item list-group-item-action"}) -# получаем список всех html тегов, в которых есть атрибут "class", равный: "list-group-item list-group-item-action" - -for button in buttons: - # выводим текст каждого тега - print(button.text) - -# от сердца и почек -# дарю вам питончик -# made by perfecto +with psyc.connect(dbname="db_for_parse", user="perfecto") as conn: + with conn.cursor() as cursor: + for i, product in enumerate(products): + img_tag = product.find(attrs={"class": "imagef"}).find("img") + title = img_tag.attrs.get("alt") + image = url + img_tag.attrs.get("src") + download(url + img_tag.attrs.get("src"), f"images/{i}.jpg") + cursor.execute(f"insert into images(link, name) values ('{image}', '{title}')") + + conn.commit() From 2cf82629d9f16c61dcd85b16b2ea42020aded6d9 Mon Sep 17 00:00:00 2001 From: Sklvd Date: Sat, 25 Mar 2023 15:12:50 +0300 Subject: [PATCH 06/34] for parsing in db --- .idea/workspace.xml | 32 +++++++++++++++++--- Задания/task1/Kluchinskaya1/parsing_in_bd.py | 26 ++++++++++++++++ 2 files changed, 54 insertions(+), 4 deletions(-) create mode 100644 Задания/task1/Kluchinskaya1/parsing_in_bd.py diff --git a/.idea/workspace.xml b/.idea/workspace.xml index de61904..58a49ff 100644 --- a/.idea/workspace.xml +++ b/.idea/workspace.xml @@ -4,7 +4,10 @@ +