Обновлённ пример кода с Pars
This commit is contained in:
+35
-28
@@ -34,43 +34,50 @@ for index, url in enumerate(urlList):
|
|||||||
|
|
||||||
- The **mkdir** method is used to create a folder with the name _nameDir_ if it does not already exist.
|
- The **mkdir** method is used to create a folder with the name _nameDir_ if it does not already exist.
|
||||||
|
|
||||||
### Example Parser Using ipars:
|
### Example Using the Pars Class:
|
||||||
|
|
||||||
```py
|
```py
|
||||||
# About the ProgressBarManager class, read below
|
# About the ProgressBarManager class, read below
|
||||||
from ipars import Pars, ProgressBarManager
|
from ipars import Pars, ProgressBarManager
|
||||||
p = Pars()
|
p = Pars()
|
||||||
nameFile = 'index.html'
|
nameFile = 'index.html'
|
||||||
|
|
||||||
# Getting the HTML page
|
|
||||||
p.getDynamicPage(nameFile, 'https://duckduckgo.com/?q=теплица+социальных+технологий+youtube&iar=videos&atb=v454-1', closeWindow=0)
|
|
||||||
|
|
||||||
# Getting the BeautifulSoup Object
|
|
||||||
soup = p.returnBs4Object(nameFile)
|
|
||||||
|
|
||||||
# Finding all answer cards
|
|
||||||
# The first results are what we wanted, and the rest are not. Therefore, we prefer to get the first 84 elements
|
|
||||||
allCards = soup.find*all(class*='b_NgmZrVnRtV8MZMEjLs')[:84]
|
|
||||||
|
|
||||||
# Getting all images
|
|
||||||
allImg = [card.find('img') for card in allCards]
|
|
||||||
|
|
||||||
# Getting all links
|
|
||||||
allSrc = p.getAttributes(allImg, 'src')
|
|
||||||
|
|
||||||
# Creating a folder img if it does not already exist
|
|
||||||
nameFolder = 'img'
|
nameFolder = 'img'
|
||||||
p.mkdir(nameFolder)
|
|
||||||
|
|
||||||
# Creating a ProgressBarManager object
|
# Getting the HTML page
|
||||||
bar = ProgressBarManager(len(allSrc))
|
p.getDynamicPage(nameFile, 'https://duckduckgo.com/?q=теплица+социальных+технологий+youtube&iar=videos&atb=v454-1', closeWindow=False, timeSleep=5)
|
||||||
|
|
||||||
# Downloading images
|
# Getting the BeautifulSoup Object
|
||||||
for index, url in enumerate(allSrc):
|
soup = p.returnBs4Object(nameFile)
|
||||||
url = 'https:' + url
|
|
||||||
p.getStaticPage(f'./{nameFolder}/img{index}.png', url, writeMethod='wb')
|
# Finding all answer cards
|
||||||
bar.next()
|
# The first results are what we wanted, and the rest are not. Therefore, we prefer to get the first 84 elements
|
||||||
bar.finish()
|
locator = 'b_NgmZrVnRtV8MZMEjLs'
|
||||||
|
allCards = soup.find_all(class_=locator)[:84]
|
||||||
|
|
||||||
|
# Getting all images
|
||||||
|
allImg = [card.find('img') for card in allCards]
|
||||||
|
|
||||||
|
# Getting all links
|
||||||
|
allSrc = p.getAttributes(allImg, 'src')
|
||||||
|
|
||||||
|
# Creating a folder img if it does not already exist
|
||||||
|
p.mkdir(nameFolder)
|
||||||
|
|
||||||
|
# Creating a ProgressBarManager object
|
||||||
|
bar = ProgressBarManager(len(allSrc))
|
||||||
|
|
||||||
|
# Downloading images
|
||||||
|
for index, url in enumerate(allSrc):
|
||||||
|
url = 'https:' + url
|
||||||
|
p.getStaticPage(f'./{nameFolder}/img{index}.png', url, writeMethod='wb')
|
||||||
|
bar.next()
|
||||||
|
bar.finish()
|
||||||
|
|
||||||
|
# Let's see what appeared in the img folder
|
||||||
|
p.pprint(p.listdir(nameFolder))
|
||||||
|
|
||||||
|
if __name__=='__main__':
|
||||||
|
main()
|
||||||
```
|
```
|
||||||
|
|
||||||
### Example Usage of _getAttributes_ and _getTexts_ Methods
|
### Example Usage of _getAttributes_ and _getTexts_ Methods
|
||||||
|
|||||||
+43
-28
@@ -34,43 +34,58 @@ for index, url in enumerate(urlList):
|
|||||||
|
|
||||||
- Метод **mkdir** используется для создания папки с именем _nameDir_ если она ещё не существует
|
- Метод **mkdir** используется для создания папки с именем _nameDir_ если она ещё не существует
|
||||||
|
|
||||||
### Пример парсера с использованием ipars:
|
- Метод **listdir** используется для получения списка файлов в указанной папке
|
||||||
|
|
||||||
|
### Пример использования класса Pars:
|
||||||
|
|
||||||
```py
|
```py
|
||||||
# О классе ProgressBarManager читай ниже
|
# О классе ProgressBarManager читай ниже
|
||||||
from ipars import Pars, ProgressBarManager
|
from ipars import Pars, ProgressBarManager
|
||||||
p = Pars()
|
p = Pars()
|
||||||
nameFile = 'index.html'
|
nameFile = 'index.html'
|
||||||
|
|
||||||
# Получаем html страницу
|
|
||||||
p.getDynamicPage(nameFile, 'https://duckduckgo.com/?q=теплица+социальных+технологий+youtube&iar=videos&atb=v454-1', closeWindow=0)
|
|
||||||
|
|
||||||
# Получаем объект BautifullSoup
|
|
||||||
soup = p.returnBs4Object(nameFile)
|
|
||||||
|
|
||||||
# Находим все карточки ответов
|
|
||||||
# Первые результаты выдачи те что хотелось получить, а остальные нет. Поэтому нам желательно получить первые 84 элемента
|
|
||||||
allCards = soup.find_all(class_='b_NgmZrVnRtV8MZMEjLs')[:84]
|
|
||||||
|
|
||||||
# Получаем все изображения
|
|
||||||
allImg = [card.find('img') for card in allCards]
|
|
||||||
|
|
||||||
# Получаем все ссылки
|
|
||||||
allSrc = p.getAttributes(allImg, 'src')
|
|
||||||
|
|
||||||
# Создаём папку img если её ещё нет
|
|
||||||
nameFolder = 'img'
|
nameFolder = 'img'
|
||||||
p.mkdir(nameFolder)
|
|
||||||
|
|
||||||
# Создаём объект ProgressBarManager
|
def main():
|
||||||
bar = ProgressBarManager(len(allSrc))
|
# Получаем html страницу
|
||||||
|
p.getDynamicPage(nameFile, 'https://duckduckgo.com/?q=теплица+социальных+технологий+youtube&iar=videos&atb=v454-1', closeWindow=False, timeSleep=5)
|
||||||
|
|
||||||
# Скачиваем картинки
|
# Получаем объект BautifullSoup
|
||||||
for index, url in enumerate(allSrc):
|
soup = p.returnBs4Object(nameFile)
|
||||||
url = 'https:' + url
|
|
||||||
p.getStaticPage(f'./{nameFolder}/img{index}.png', url, writeMethod='wb')
|
# Находим все карточки ответов
|
||||||
bar.next()
|
# Первые результаты выдачи те что хотелось получить, а остальные нет. Поэтому нам желательно получить первые 84 элемента
|
||||||
bar.finish()
|
locator = 'b_NgmZrVnRtV8MZMEjLs'
|
||||||
|
allCards = soup.find_all(class_=locator)[:84]
|
||||||
|
if len(allCards) == 0:
|
||||||
|
print(f'''Something went wrong. Here is a list of possible causes:
|
||||||
|
1) DuckDuckGo has changed the class for video cards. The code uses the locator "{locator}"
|
||||||
|
2) The site did not load. Try increasing the timeSleep parameter or make a request later.''')
|
||||||
|
return
|
||||||
|
|
||||||
|
# Получаем все изображения
|
||||||
|
allImg = [card.find('img') for card in allCards]
|
||||||
|
|
||||||
|
# Получаем все ссылки
|
||||||
|
allSrc = p.getAttributes(allImg, 'src')
|
||||||
|
|
||||||
|
# Создаём папку img если её ещё нет
|
||||||
|
p.mkdir(nameFolder)
|
||||||
|
|
||||||
|
# Создаём объект ProgressBarManager
|
||||||
|
bar = ProgressBarManager(len(allSrc))
|
||||||
|
|
||||||
|
# Скачиваем картинки
|
||||||
|
for index, url in enumerate(allSrc):
|
||||||
|
url = 'https:' + url
|
||||||
|
p.getStaticPage(f'./{nameFolder}/img{index}.png', url, writeMethod='wb')
|
||||||
|
bar.next()
|
||||||
|
bar.finish()
|
||||||
|
|
||||||
|
# Смотрим что появилось в папке img
|
||||||
|
p.pprint(p.listdir(nameFolder))
|
||||||
|
|
||||||
|
if __name__=='__main__':
|
||||||
|
main()
|
||||||
```
|
```
|
||||||
|
|
||||||
### Пример использования методов _getAttributes_ и _getTexts_
|
### Пример использования методов _getAttributes_ и _getTexts_
|
||||||
|
|||||||
Reference in New Issue
Block a user