Pular para o conteúdo principal

Curso

Fundamentos de Big Data com PySpark

Avançado4 h

Domine o básico do PySpark e trabalhe com grandes volumes de dados.

Python4 h16 vídeos55 exercícios4,600 XP65,832Declaração de aproveitamento

Crie sua conta gratuita

Continuar com o Google
ou
Ao continuar, você aceita nossos Termos de uso, nosso Política de privacidade e que seus dados sejam armazenados nos EUA.

Amado por alunos em milhares de empresas

Treinando um time?

Teste para empresas

Descrição do curso

Nos últimos anos, tem havido muito burburinho sobre Big Data, e ele finalmente se tornou popular para muitas empresas. Mas o que é esse Big Data? Este curso aborda os fundamentos do Big Data por meio do PySpark. O Spark é uma estrutura de "computação em cluster extremamente rápida" para Big Data. Ele fornece um mecanismo de plataforma de processamento de dados geral e permite que você execute programas até 100 vezes mais rápido na memória ou 10 vezes mais rápido no disco do que o Hadoop. Você usará o PySpark, um pacote Python para programação do Spark e suas poderosas bibliotecas de nível superior, como SparkSQL, MLlib (para aprendizado de máquina), etc. Você explorará as obras de William Shakespeare, analisará dados da Fifa 2018 e realizará clustering em conjuntos de dados genômicos. Ao final deste curso, você terá adquirido um conhecimento profundo do PySpark e de sua aplicação à análise geral de Big Data.

Pré-requisitos

Programa de estudos

Conteúdo do curso

1

Introdução à análise de Big Data com o Spark

Este capítulo apresenta o empolgante mundo do Big Data, bem como os vários conceitos e estruturas diferentes para o processamento de Big Data. Você entenderá por que o Apache Spark é considerado o melhor framework para BigData.
Começar capítulo
4

Aprendizado de máquina com PySpark MLlib

PySpark MLlib é a biblioteca de aprendizado de máquina escalável do Apache Spark em Python, que consiste em algoritmos e utilitários comuns de aprendizado. Ao longo deste último capítulo, você aprenderá algoritmos importantes de aprendizado de máquina. Você criará um mecanismo de recomendação de filmes e um filtro de spam e usará o k-means clustering.
Começar capítulo

Fundamentos de Big Data com PySpark

Curso
concluído

Obtenha o certificado de conclusão

Inscreva-se agora

Desenvolva suas habilidades em dados com o DataCamp for Mobile

Continue progredindo em qualquer lugar com nossos cursos e desafios diários de programação de 5 minutos.