Курс Python → Парсинг веб-страниц с Beautiful Soup

Веб-парсинг — это процесс извлечения данных с веб-страниц с целью их анализа или использования в других приложениях. Для этой задачи существует множество библиотек на Python, одними из самых популярных являются Beautiful Soup и Scrapy.

Beautiful Soup — это библиотека, которая позволяет удобно парсить HTML и XML документы. Она предоставляет простой интерфейс для навигации по дереву HTML и извлечения нужных данных. Например, с помощью Beautiful Soup можно легко найти все ссылки на странице или извлечь текст из определенных тегов.

Scrapy — это более мощный инструмент для веб-парсинга, который позволяет создавать полноценные веб-пауки для автоматического сбора данных с нескольких страниц или сайтов. С его помощью можно настраивать правила извлечения данных, обходить различные ограничения и сохранять результаты в нужном формате.

Давайте рассмотрим пример использования Beautiful Soup для получения значения валюты по сравнению с долларом США. Допустим, у нас есть HTML страница с курсами валют, и нам нужно извлечь значение валюты по отношению к доллару. Мы можем использовать Beautiful Soup для поиска нужной информации в HTML коде и извлечения ее. Пример кода может выглядеть следующим образом:

from bs4 import BeautifulSoup
import requests

url = 'https://example.com/currency'
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')

currency_value = soup.find('span', {'class': 'currency-value'}).text
print(currency_value)

В данном примере мы отправляем GET запрос на страницу с курсами валют, загружаем HTML код, создаем объект Beautiful Soup и используем метод find для поиска элемента с определенным классом. Затем мы извлекаем текст из этого элемента и выводим его на экран. Таким образом, мы можем легко получить нужные данные с веб-страницы с помощью Python и Beautiful Soup.

Твои коллеги будут рады, поделись в

Автор урока

Дмитрий Комаровский
Дмитрий Комаровский

Автоматизация процессов
в КраснодарБанки.ру

Другие уроки курса "Python"

  1. Измерение времени выполнения кода в Python
  2. Конвертация коллекций в Python.
  3. Манипуляция формой массива в Numpy
  4. Работа с классами данных
  5. Замена текста в Python
  6. Печать календаря
  7. Использование модуля math
  8. Функция reduce() из модуля functools
  9. Работа с аргументами командной строки
  10. Удаление ключа из словаря
  11. Работа с массивами в Python
  12. Работа с collections.Counter
  13. Проверка типов с использованием isinstance
  14. Проверка типа объекта в Python
  15. Декоратор @override
  16. Измерение потребления памяти при сортировке
  17. Конвертация текстовых чисел с помощью Numerizer
  18. Работа с байтовыми строками в Python
  19. Оператор Walrus в Python 3.8
  20. Преобразование списка в словарь через генератор
  21. Иерархия классов в Python
  22. Хранение переменных в Python.
  23. Изменение логики работы с временем
  24. Расчет времени выполнения
  25. Работа со случайными элементами
  26. Функция findall() для поиска вхождений строки
  27. Поиск простых чисел
  28. Метод join для наборов
  29. Проверка файла .py на синтаксис.
  30. Профилирование с Pandas
  31. Добавление цвета в консоли
  32. Генераторы в Python
  33. Работа со списками
  34. Замена переменных в Python
  35. Метод join() для объединения элементов строки
  36. Метод rpow в Python
  37. Подсчет часто встречающихся элементов
  38. Python Enumerate
  39. Быстрый поиск кода
  40. Проверка на истинность объектов в Python
  41. Преобразование многоуровневого словаря
  42. Python enumerate() использование
  43. Объединение строк с помощью метода join
  44. Переменные в Python: сокращение гласных
  45. Работа с каталогами в Python
  46. Docstring в Python

Marketello читают маркетологи из крутых компаний