Курс Python → Удаление дубликатов в pandas

Для удаления дублирующихся данных в Python можно воспользоваться методом drop_duplicates() из библиотеки pandas. Этот метод позволяет удалить строки с дублирующимися значениями в указанных столбцах. Например, если у вас есть DataFrame df и вы хотите удалить дубликаты в столбце ‘name’, то код будет выглядеть следующим образом:


df.drop_duplicates(subset=['name'], keep='first', inplace=True)

В данном примере мы указали столбец ‘name’ как ключ для поиска дубликатов. Аргумент keep=’first’ означает, что будет оставлен первый встреченный дубликат, а остальные будут удалены. Если вы хотите сохранить последний дубликат, замените ‘first’ на ‘last’.

Если вы хотите удалить дубликаты по всем столбцам, то просто укажите аргумент subset=None:


df.drop_duplicates(subset=None, keep='first', inplace=True)

После выполнения этой операции DataFrame будет содержать только уникальные строки. Удаление дубликатов помогает упростить анализ данных и избежать искажений в результатах. Помните, что перед удалением дубликатов всегда стоит проанализировать данные и убедиться, что удаление не повредит целостности информации.

Твои коллеги будут рады, поделись в

Автор урока

Дмитрий Комаровский
Дмитрий Комаровский

Автоматизация процессов
в КраснодарБанки.ру

Другие уроки курса "Python"

  1. Добавление Progressbar в Python
  2. Применение функции к списку
  3. Переопределение метода
  4. Поиск файлов по шаблону
  5. Генераторы в Python
  6. Срезы в Numpy
  7. Разделение строки с регулярными выражениями
  8. Построение графиков в терминале с bashplotlib
  9. Декораторы в Python
  10. Тернарный оператор в Python
  11. Цепные операции в Python
  12. Передача аргументов в Python
  13. Модуль functools в Python
  14. Подсчет элементов в Python
  15. Генератор данных в Keras
  16. Работа с IP-адресами в Python
  17. Удаление эмодзи с помощью pandas
  18. Конкатенация строк в Python
  19. Преобразование букв в нижний регистр
  20. Big O оптимизация
  21. Экспорт внешнего файла с помощью writefile
  22. Подчеркивание в REPL
  23. Каналы Senior: Python, Java, Frontend, SQL, C++
  24. Вакансии в Nebius
  25. Генератор надежных паролей
  26. Модуль pprint: улучшение вывода данных
  27. Сортировка с помощью key
  28. Обновление данных через PUT запрос
  29. Метод radd для пользовательских чисел
  30. Получение обратного списка чисел
  31. Удаление дубликатов из списка с помощью dict.fromkeys
  32. Преобразование типов данных в set comprehension
  33. Печать списка с помощью метода join
  34. Progress с библиотекой tqdm
  35. Создание вкладок с TKinter
  36. Список переменных в Python
  37. ChainMap.new_child() — добавление нового словаря
  38. Antigravity модуль
  39. Замена символов в строке
  40. Регулярные выражения в Python
  41. Функция enumerate() в Python
  42. Работа с контекстным менеджером Pool
  43. Счетчик ссылок в Python
  44. Загрузка постов Instagram
  45. Оптимизация строк в Python

Marketello читают маркетологи из крутых компаний