PasseiApostilas

Apostila Profissional Júnior Transpetro - Ciência de Dados — Concurso Transpetro/BR 2026

929 páginas3353 questões comentadasBanca Fundação CesgranrioProva 24 a 27/11/2026PDF · Download imediato
Apostila digital completa
R$ 59,90
Acesso enviado por e-mail imediatamente após o pagamento
Carregando oferta…

Sobre esta apostila

Apostila completa para Profissional Júnior Transpetro - Ciência de Dados do concurso Transpetro/BR 2026: 929 páginas de teoria direcionada, 3353 questões comentadas e resumos. Banca Fundação Cesgranrio. Download imediato após o pagamento + amostra grátis.

Conteúdo Programático da Apostila

Conhecimentos Básicos

LÍNGUA PORTUGUESA

  • Compreensão e Interpretação de textos
  • Ortografia oficial e Acentuação Gráfica
  • Mecanismos de coesão textual
  • Semântica: Significação das palavras
  • Morfologia: Emprego e flexão das classes de palavras
  • Verbos: Emprego de tempos e modos verbais
  • Sintaxe: Períodos compostos por coordenação e por subordinação
  • Pontuação: Emprego dos sinais de pontuação
  • Concordância verbal e nominal
  • Regência verbal e nominal
  • Crase: Emprego do sinal indicativo de crase
  • Colocação dos pronomes átonos (Próclise, Ênclise e Mesóclise)

INGLÊS

  • Compreensão de texto escrito em língua inglesa
  • Itens gramaticais relevantes para a compreensão dos conteúdos semânticos

RACIOCÍNIO LÓGICO E MATEMÁTICA

  • Cálculo Diferencial e Integral: Funções, limites e derivadas
  • Cálculo Avançado: Derivadas parciais, máximos e mínimos e integrais
  • Álgebra Linear: Vetores e matrizes (operações e tipos)
  • Espaços Vetoriais: Transformações lineares, espaços e subespaços de Rn
  • Sistemas de equações lineares
  • Normas: L1, L2, infinita, p-generalizada, Minkowksi e Chebyshev
  • Decomposição Matricial: Autovalores e autovetores
  • Decomposição de Matrizes: Cholesky e Singular Value Decomposition (SVD)

ESTATÍSTICA

  • Fundamentos de Probabilidade: Definições básicas, axiomas e probabilidade condicional
  • Variáveis Aleatórias: Funções de probabilidade discretas e contínuas
  • Principais Distribuições: Uniforme, Binomial, Normal, Poisson, Bernoulli e Exponencial
  • Estatística Descritiva: Medidas de tendência central (média, mediana, moda)
  • Medidas de Dispersão: Variância, desvio padrão e amplitude
  • Medidas de Posição: Percentis e quartis
  • Teoremas Fundamentais: Independência de eventos e Teorema de Bayes
  • Leis Estatísticas: Teorema da probabilidade total, Lei dos grandes números e Teorema central do limite
  • Distribuições Amostrais: Média, proporção, Qui-quadrado, t de Student e Distribuição F
  • Inferência Estatística: Estimação pontual e intervalar (Intervalos de confiança)
  • Testes de Hipóteses: Formulação, tipos de erros (I e II) e poder do teste
  • Testes Paramétricos e Não Paramétricos: Testes z e t para médias e proporções
  • Testes de Aderência e Independência: Qui-quadrado (Goodness-of-Fit) e Teste A/B
  • Correlação e Causalidade: Correlação de Pearson, Spearman e correlação parcial

Conhecimentos Específicos

CIÊNCIA DE DADOS

  • Conceitos Fundamentais: Dados, informação e conhecimento
  • Tipos de Dados: Qualitativos (nominal, ordinal) e quantitativos (discretos, contínuos)
  • Tidy Data e Formatos de Arquivos de Dados: txt, csv, xlsx, xml e json
  • Introdução a Bases de Dados: O que são bases de dados e metadados
  • Introdução ao Armazenamento de Dados: Armazenamento de arquivos e armazenamento na nuvem
  • Estruturas de Armazenamento Analítico: Data Warehouse, Data Mart, Data Lake e Data Lakehouse — diferenças conceituais e casos de uso
  • Sistemas Gerenciadores de Bases de Dados (SGBDs): Definição, principais funções, tipos (SQL e NoSQL), transações, índices, controle de acesso e regras de integridade
  • Modelo de Dados: Entidade-Relacionamento (ER), modelo relacional (tabelas, esquemas, chaves primária e estrangeira, consultas) e dados estruturados, semiestruturados e não estruturados
  • Modelos Não Relacionais: Chave-valor, colunar, orientado a documentos e orientado a grafos
  • Big Data: Conceito, técnicas e ferramentas para grandes volumes (Spark, Hadoop, Parquet, HDFS e MapReduce)
  • Ciclo de vida de projetos de ciência de dados
  • Metodologias de Gestão de Projetos de Dados: CRISP-DM, Microsoft Team Data Science Process (TDSP), OSEMN e princípios de métodos ágeis (Scrum/Kanban)
  • Metadados e Qualidade de Dados: Importância para avaliação da qualidade e linhagem de dados
  • Coleta de Dados: Fontes comuns internas e externas e técnicas de web scraping
  • Problemas Comuns de Qualidade de Dados: Valores ausentes, duplicatas, outliers, desbalanceamento e erros de imputação
  • Preparação de Dados: Técnicas de tratamento e limpeza, detecção de vieses e data profiling
  • Pré-processamento de Dados: Normalização, padronização, discretização e codificação de variáveis categóricas (encoding)
  • Feature Engineering: Enriquecimento de dados, criação e seleção de features relevantes e transformações matemáticas e estatísticas
  • Divisão de Dados: Técnicas de amostragem, divisão entre treinamento, validação e teste e abordagens para cross-validation
  • Pipeline de treinamento de modelos e suas etapas
  • Otimização de Hiperparâmetros: Grid search, random search, algoritmos de otimização avançados, automl, autotuning e autofeature engineering
  • Métricas para Avaliação de Regressão: MSE, RMSE, MAE, R² e R² ajustado
  • Métricas para Avaliação de Classificação: Accuracy, precision, recall, F1-score, ROC-AUC e análise de matriz de confusão
  • Trade-off entre viés e variância: Detecção de overfitting e underfitting
  • Técnicas de Regularização: Lasso, ridge, elastic net, dropout, early stopping e batch normalization
  • Dados Desbalanceados: Oversampling, undersampling, dados sintéticos e ajuste de pesos
  • Validação de Modelos: K-fold cross-validation, leave-one-out cross-validation e bootstrap
  • Modelagem de IA centrada em dados (data-centric)
  • Redução de Dimensionalidade: Principal Component Analysis (PCA), LDA, ICA, T-SNE e autoencoders
  • Técnicas de Clusterização: K-Means, agrupamento hierárquico, Gaussian Mixture Models e DBSCAN
  • Técnicas de Classificação: Regressão logística, K-Nearest Neighbors (KNN), Support Vector Machines (SVM), Decision Trees (CART), Naive-Bayes (Binomial-Beta, Poisson-Gama, Normal-Normal) e Florestas Aleatórias (Random Forest)
  • Introdução à Regressão: Linear simples e múltipla, hipóteses clássicas e método dos mínimos quadrados
  • Diagnóstico e Avaliação de Modelos de Regressão: F-test, coeficiente de determinação, análise de resíduos, testes de significância, intervalos de confiança, análise ANOVA e modelos não lineares (log-log, lin-log, log-lin e inverso)
  • Ensembling de Modelos: Bagging, boosting (AdaBoost, Gradient Boosting, XGBoost, LightGBM e CatBoost) e stacking
  • Sistemas de Recomendação: Filtragem colaborativa (usuários ou itens), baseada em conteúdo, sistemas híbridos e problemas comuns (cold start, escalabilidade e data sparsity)
  • Séries Temporais: Definição, componentes (tendência, sazonalidade, ciclos e ruído), autocorrelação e autocorrelação parcial
  • Modelos de Séries Temporais: Estacionaridade e seus testes, cointegração, modelos AR, ARMA, ARIMA, ARIMAX, suavização exponencial e modelos de decomposição
  • Tópicos em Regressão: Dados em painel, GLM, regressão espacial, regressão quantílica, regressão de Poisson, modelos VAR, ECM e GARCH
  • Introdução a Modelos Causais: Fundamentos de causalidade estatística, experimentos e quase-experimentos, desenho de descontinuidade de regressão, variáveis instrumentais, diferenças em diferenças e métodos de pareamento
  • Redes Neurais Artificiais: Arquitetura, funções de ativação, treinamento, forward pass, backpropagation, loss functions, algoritmos de otimização, épocas e batch size
  • Deep Learning: Embeddings, redes profundas, Redes Neurais Convolucionais (CNNs) e Recorrentes (RNNs), LSTM, GRU, GAN e modelos multimodais
  • Pré-processamento de Texto em NLP: Limpeza, normalização, remoção de stop words, stemming e lematização
  • Representação de Texto: N-grams, CBoW, TF-IDF, word embeddings (Word2Vec e GloVe) e document embeddings (Doc2Vec, BERT e ELMo)
  • Modelagem de Tópicos: Latent Dirichlet Allocation (LDA) e Non-negative Matrix Factorization (NMF)
  • Modelos de Linguagem: Tradicionais, redes neurais recorrentes, redes neurais convolucionais e transformers
  • Tarefas Básicas em NLP: Classificação de texto, análise de sentimento, extração de informação (NER e REL), similaridade textual, sumarização, POS-tagging e tradução automática
  • Python: Sintaxe básica, operadores, variáveis e estruturas de dados (dataframes, listas, matrizes, dicionários e conjuntos)
  • Python: Estruturas de controle de fluxo, funções, escopo, métodos, paralelização de rotinas, serialização e desserialização
  • Bibliotecas Python para Manipulação e Visualização: Pandas, NumPy, Matplotlib e Seaborn
  • Bibliotecas Python para Modelagem: TensorFlow, Keras, PyTorch, Scikit-learn, XGBoost, NLTK, spaCy, huggingface, PySpark, Beautiful Soup e Streamlit
  • Linguagem SQL: Conceitos introdutórios, comandos de consulta (inserção, atualização e exclusão) e análise de dados (funções de agregação, filtros, joins e subconsultas)
  • Microsoft Power BI: Conexão e importação de dados, modelagem, medidas e colunas calculadas, visualizações, interações, relatórios e painéis
  • Tipos de Visualizações e Gráficos: Tabela, barras, linhas, pizza, dispersão, histograma, área, boxplot, bolhas, radar, mapas cartográficos e mapa de calor
  • Visualização de Dados: Princípios de design de gráficos efetivos, codificação visual, interatividade e acessibilidade
  • Dashboards: Construção de interfaces e layout, escolha de designs, organização de elementos visuais, seleção de gráficos, interatividades, drill-downs e acessibilidade
  • Storytelling com Dados: Construção de narrativas visuais, contextualização e componentes de um storytelling efetivo
  • Governança de Dados (DMBOK): Conceitos, objetivos, técnicas de qualidade e integridade de dados e princípios de privacidade e proteção a dados
  • Governança de IA: Conceitos, objetivos e gestão de riscos em IA
  • Riscos e Vulnerabilidades em IA: Viés algorítmico, exposição de dados sensíveis, envenenamento de dados de treinamento, ataques adversariais, manipulação e roubo de modelos, ataque de inferência e alucinações
  • Aplicação de IA Responsável: Definição, ética, transparência, justiça e equidade, responsabilização, segurança cibernética e compliance regulatório

Legislação

LEGISLAÇÃO

  • Lei nº 13.709/2018 - Lei Geral de Proteção de Dados Pessoais (LGPD)

Dúvidas Frequentes

O que contém a apostila para Profissional Júnior Transpetro - Ciência de Dados?

A apostila contém 929 páginas com teoria completa e 3353 questões comentadas, cobrindo o conteúdo programático do edital para o cargo de Profissional Júnior Transpetro - Ciência de Dados no concurso Transpetro/BR.

Como recebo o material após a compra?

Após a confirmação do pagamento você recebe imediatamente o link para download dos arquivos em PDF no seu e-mail — sem esperar dias pela entrega.

Posso ver uma amostra antes de comprar?

Sim! A página da apostila tem uma amostra gratuita em PDF para você avaliar a qualidade do material antes de decidir.

A apostila está atualizada com o edital do Transpetro/BR?

Sim. O material é elaborado com base no edital mais recente do concurso Transpetro/BR, incluindo a legislação e o conteúdo programático vigentes.