Выбор страны покажет курсы, доступные в вашем регионе.
⏱ 2 ч 42 мин📚 27 уроков🎧 Аудиоверсия
Основы больших данных с Python и PySpark
Этот курс учит начинающих основных навыков для эффективной обработки и анализа крупномасштабных наборов данных с использованием Python и Apache Spark.
💬ИИ инструктор Задавайте вопросы по любому уроку — понятный ответ придёт мгновенно, в любой момент.
🕐Начните в любое время Без расписаний и дедлайнов — учитесь в своём темпе, когда удобно.
🌐На русском языке Уроки, задания и сертификат — всё полностью на вашем языке.
О курсе
Большие данные требуют специализированных инструментов для обработки огромных объемов информации, которые стандартное программное обеспечение не может обрабатывать. PySpark обеспечивает важную связь между знакомыми инструментами Python для обработки данных и мощностью распределенных вычислений.
К концу этого курса вы овладеете настройкой среды обработки данных, манипулированием большими наборами данных с помощью библиотек анализа данных Python и применением PySpark для выполнения масштабируемых преобразований, анализа и основных задач машинного обучения на распределенных кластерах.
Что вы узнаете:
* Понять основные концепции распределенных вычислений и архитектуры Apache Spark.
* Освоить основные структуры данных Python и использовать библиотеку pandas для эффективного манипулирования локальными данными.
* Примените PySpark DataFrames и Spark SQL для чтения, очистки и преобразования массивных структурированных наборов данных.
* Настройка базовых виртуальных сред и управление зависимостями для масштабируемых проектов науки данных.
* Практика общих преобразований данных, агрегаций, соединений и методов оптимизации запросов в PySpark.
* Узнайте, как выполнять базовое поглощение потоковых данных и применять модели машинного обучения с помощью MLlib.
Курс начинается с прочной основы в работе с данными Python и настройки среды перед введением основных концепций распределенной обработки. Затем мы переходим к практическому применению с использованием PySpark DataFrames, сосредоточившись на масштабируемом манипулировании данными и анализе, завершающемся введением в потоковые и машинные инструменты обучения.
Этот курс предназначен для абсолютно начинающих, заинтересованных в инженерии данных, науке данных или анализе данной, которым нужно работать с большими наборами данных. Не требуется предыдущий опыт работы со Spark или распределенными системами.
Начните накапливать опыт в области масштабируемой обработки данных уже сегодня.
Что вы получите
📜Сертификат об окончании Добавьте в профиль LinkedIn
💬Личный AI-наставник Застрял на уроке? Спроси встроенного наставника о чём угодно, в любой момент.
🎧Аудиоверсия включена Учитесь в дороге — экран не нужен
♾️Пожизненный доступ Возвращайтесь в любое время, без срока
📱Телефон или компьютер Работает везде и на любом устройстве
💸Возврат в течение 14 дней Без вопросов
⚡Кратко и по делу 2 ч 42 мин практического материала
Сертификат об окончании
Каждый курс, который ты завершаешь на PickAClass, выдаёт такой сертификат — оригинальный, со своим кодом, проверяемый по URL и подробный о том, что реально продемонстрировано.