Курс Python → Парсинг веб-страниц с Beautiful Soup

Веб-парсинг — это процесс извлечения данных с веб-страниц с целью их анализа или использования в других приложениях. Для этой задачи существует множество библиотек на Python, одними из самых популярных являются Beautiful Soup и Scrapy.

Beautiful Soup — это библиотека, которая позволяет удобно парсить HTML и XML документы. Она предоставляет простой интерфейс для навигации по дереву HTML и извлечения нужных данных. Например, с помощью Beautiful Soup можно легко найти все ссылки на странице или извлечь текст из определенных тегов.

Scrapy — это более мощный инструмент для веб-парсинга, который позволяет создавать полноценные веб-пауки для автоматического сбора данных с нескольких страниц или сайтов. С его помощью можно настраивать правила извлечения данных, обходить различные ограничения и сохранять результаты в нужном формате.

Давайте рассмотрим пример использования Beautiful Soup для получения значения валюты по сравнению с долларом США. Допустим, у нас есть HTML страница с курсами валют, и нам нужно извлечь значение валюты по отношению к доллару. Мы можем использовать Beautiful Soup для поиска нужной информации в HTML коде и извлечения ее. Пример кода может выглядеть следующим образом:

from bs4 import BeautifulSoup
import requests

url = 'https://example.com/currency'
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')

currency_value = soup.find('span', {'class': 'currency-value'}).text
print(currency_value)

В данном примере мы отправляем GET запрос на страницу с курсами валют, загружаем HTML код, создаем объект Beautiful Soup и используем метод find для поиска элемента с определенным классом. Затем мы извлекаем текст из этого элемента и выводим его на экран. Таким образом, мы можем легко получить нужные данные с веб-страницы с помощью Python и Beautiful Soup.

Твои коллеги будут рады, поделись в

Автор урока

Дмитрий Комаровский
Дмитрий Комаровский

Автоматизация процессов
в КраснодарБанки.ру

Другие уроки курса "Python"

  1. Метод split() для разделения строк
  2. Docstring в Python
  3. Объединение словарей в Python
  4. Поиск шаблона в строке
  5. Измерение времени выполнения кода
  6. Именованные кортежи в Python
  7. Оператор @ для умножения матриц
  8. Конвертация текстовых чисел с помощью Numerizer
  9. Удаление пробелов методом translate()
  10. Проверка дублей в списке.
  11. Перевод двоичного кода в целое число
  12. Вывод баннеров
  13. Аннотации типов в Python
  14. Переопределение метода __or__()
  15. Удаление файлов с shutil.os.remove()
  16. Использование метода lower()
  17. Создание новых списков
  18. Метод Enumerate() для списков
  19. Магические методы в Python
  20. Открытие и запись файлов
  21. Применение промокода в Много лосося
  22. Добавление вложенных списков
  23. Использование функции product
  24. Метод rsub для пользовательских чисел
  25. Просмотр атрибутов и методов класса
  26. Секреты Python
  27. Создание словарей в Python
  28. Решатель судоку на Python с pygame
  29. Хеши в Python
  30. Метод clear для коллекций
  31. Python enumerate() использование
  32. Переопределение метода __eq__
  33. Работа с географическими данными в Python
  34. Генераторные функции в Python
  35. JSON в Python: модуль, dump, dumps, load
  36. Работа с дробями в Python
  37. Модуль pprint: улучшение вывода данных
  38. Работа с асинхронными задачами в Python
  39. Создание новых списков в Python
  40. Управление мышью и клавиатурой с Pyautogui
  41. Применение функции к каждому элементу списка
  42. Декораторы в Python
  43. Enum в Python: создание и использование перечислений
  44. Основы работы со списками
  45. Применение функции к элементам списка
  46. Получение пути к текущему скрипту с помощью os
  47. Добавление цвета в консоли
  48. Функция zip() в Python
  49. *args и **kwargs в Python

Marketello читают маркетологи из крутых компаний