Apostila Profissional Júnior Transpetro - Ciência de Dados — Concurso Transpetro/BR 2026
Sobre esta apostila
Apostila completa para Profissional Júnior Transpetro - Ciência de Dados do concurso Transpetro/BR 2026: 929 páginas de teoria direcionada, 3353 questões comentadas e resumos. Banca Fundação Cesgranrio. Download imediato após o pagamento + amostra grátis.
Conteúdo Programático da Apostila
Conhecimentos Básicos
LÍNGUA PORTUGUESA
- Compreensão e Interpretação de textos
- Ortografia oficial e Acentuação Gráfica
- Mecanismos de coesão textual
- Semântica: Significação das palavras
- Morfologia: Emprego e flexão das classes de palavras
- Verbos: Emprego de tempos e modos verbais
- Sintaxe: Períodos compostos por coordenação e por subordinação
- Pontuação: Emprego dos sinais de pontuação
- Concordância verbal e nominal
- Regência verbal e nominal
- Crase: Emprego do sinal indicativo de crase
- Colocação dos pronomes átonos (Próclise, Ênclise e Mesóclise)
INGLÊS
- Compreensão de texto escrito em língua inglesa
- Itens gramaticais relevantes para a compreensão dos conteúdos semânticos
RACIOCÍNIO LÓGICO E MATEMÁTICA
- Cálculo Diferencial e Integral: Funções, limites e derivadas
- Cálculo Avançado: Derivadas parciais, máximos e mínimos e integrais
- Álgebra Linear: Vetores e matrizes (operações e tipos)
- Espaços Vetoriais: Transformações lineares, espaços e subespaços de Rn
- Sistemas de equações lineares
- Normas: L1, L2, infinita, p-generalizada, Minkowksi e Chebyshev
- Decomposição Matricial: Autovalores e autovetores
- Decomposição de Matrizes: Cholesky e Singular Value Decomposition (SVD)
ESTATÍSTICA
- Fundamentos de Probabilidade: Definições básicas, axiomas e probabilidade condicional
- Variáveis Aleatórias: Funções de probabilidade discretas e contínuas
- Principais Distribuições: Uniforme, Binomial, Normal, Poisson, Bernoulli e Exponencial
- Estatística Descritiva: Medidas de tendência central (média, mediana, moda)
- Medidas de Dispersão: Variância, desvio padrão e amplitude
- Medidas de Posição: Percentis e quartis
- Teoremas Fundamentais: Independência de eventos e Teorema de Bayes
- Leis Estatísticas: Teorema da probabilidade total, Lei dos grandes números e Teorema central do limite
- Distribuições Amostrais: Média, proporção, Qui-quadrado, t de Student e Distribuição F
- Inferência Estatística: Estimação pontual e intervalar (Intervalos de confiança)
- Testes de Hipóteses: Formulação, tipos de erros (I e II) e poder do teste
- Testes Paramétricos e Não Paramétricos: Testes z e t para médias e proporções
- Testes de Aderência e Independência: Qui-quadrado (Goodness-of-Fit) e Teste A/B
- Correlação e Causalidade: Correlação de Pearson, Spearman e correlação parcial
Conhecimentos Específicos
CIÊNCIA DE DADOS
- Conceitos Fundamentais: Dados, informação e conhecimento
- Tipos de Dados: Qualitativos (nominal, ordinal) e quantitativos (discretos, contínuos)
- Tidy Data e Formatos de Arquivos de Dados: txt, csv, xlsx, xml e json
- Introdução a Bases de Dados: O que são bases de dados e metadados
- Introdução ao Armazenamento de Dados: Armazenamento de arquivos e armazenamento na nuvem
- Estruturas de Armazenamento Analítico: Data Warehouse, Data Mart, Data Lake e Data Lakehouse — diferenças conceituais e casos de uso
- Sistemas Gerenciadores de Bases de Dados (SGBDs): Definição, principais funções, tipos (SQL e NoSQL), transações, índices, controle de acesso e regras de integridade
- Modelo de Dados: Entidade-Relacionamento (ER), modelo relacional (tabelas, esquemas, chaves primária e estrangeira, consultas) e dados estruturados, semiestruturados e não estruturados
- Modelos Não Relacionais: Chave-valor, colunar, orientado a documentos e orientado a grafos
- Big Data: Conceito, técnicas e ferramentas para grandes volumes (Spark, Hadoop, Parquet, HDFS e MapReduce)
- Ciclo de vida de projetos de ciência de dados
- Metodologias de Gestão de Projetos de Dados: CRISP-DM, Microsoft Team Data Science Process (TDSP), OSEMN e princípios de métodos ágeis (Scrum/Kanban)
- Metadados e Qualidade de Dados: Importância para avaliação da qualidade e linhagem de dados
- Coleta de Dados: Fontes comuns internas e externas e técnicas de web scraping
- Problemas Comuns de Qualidade de Dados: Valores ausentes, duplicatas, outliers, desbalanceamento e erros de imputação
- Preparação de Dados: Técnicas de tratamento e limpeza, detecção de vieses e data profiling
- Pré-processamento de Dados: Normalização, padronização, discretização e codificação de variáveis categóricas (encoding)
- Feature Engineering: Enriquecimento de dados, criação e seleção de features relevantes e transformações matemáticas e estatísticas
- Divisão de Dados: Técnicas de amostragem, divisão entre treinamento, validação e teste e abordagens para cross-validation
- Pipeline de treinamento de modelos e suas etapas
- Otimização de Hiperparâmetros: Grid search, random search, algoritmos de otimização avançados, automl, autotuning e autofeature engineering
- Métricas para Avaliação de Regressão: MSE, RMSE, MAE, R² e R² ajustado
- Métricas para Avaliação de Classificação: Accuracy, precision, recall, F1-score, ROC-AUC e análise de matriz de confusão
- Trade-off entre viés e variância: Detecção de overfitting e underfitting
- Técnicas de Regularização: Lasso, ridge, elastic net, dropout, early stopping e batch normalization
- Dados Desbalanceados: Oversampling, undersampling, dados sintéticos e ajuste de pesos
- Validação de Modelos: K-fold cross-validation, leave-one-out cross-validation e bootstrap
- Modelagem de IA centrada em dados (data-centric)
- Redução de Dimensionalidade: Principal Component Analysis (PCA), LDA, ICA, T-SNE e autoencoders
- Técnicas de Clusterização: K-Means, agrupamento hierárquico, Gaussian Mixture Models e DBSCAN
- Técnicas de Classificação: Regressão logística, K-Nearest Neighbors (KNN), Support Vector Machines (SVM), Decision Trees (CART), Naive-Bayes (Binomial-Beta, Poisson-Gama, Normal-Normal) e Florestas Aleatórias (Random Forest)
- Introdução à Regressão: Linear simples e múltipla, hipóteses clássicas e método dos mínimos quadrados
- Diagnóstico e Avaliação de Modelos de Regressão: F-test, coeficiente de determinação, análise de resíduos, testes de significância, intervalos de confiança, análise ANOVA e modelos não lineares (log-log, lin-log, log-lin e inverso)
- Ensembling de Modelos: Bagging, boosting (AdaBoost, Gradient Boosting, XGBoost, LightGBM e CatBoost) e stacking
- Sistemas de Recomendação: Filtragem colaborativa (usuários ou itens), baseada em conteúdo, sistemas híbridos e problemas comuns (cold start, escalabilidade e data sparsity)
- Séries Temporais: Definição, componentes (tendência, sazonalidade, ciclos e ruído), autocorrelação e autocorrelação parcial
- Modelos de Séries Temporais: Estacionaridade e seus testes, cointegração, modelos AR, ARMA, ARIMA, ARIMAX, suavização exponencial e modelos de decomposição
- Tópicos em Regressão: Dados em painel, GLM, regressão espacial, regressão quantílica, regressão de Poisson, modelos VAR, ECM e GARCH
- Introdução a Modelos Causais: Fundamentos de causalidade estatística, experimentos e quase-experimentos, desenho de descontinuidade de regressão, variáveis instrumentais, diferenças em diferenças e métodos de pareamento
- Redes Neurais Artificiais: Arquitetura, funções de ativação, treinamento, forward pass, backpropagation, loss functions, algoritmos de otimização, épocas e batch size
- Deep Learning: Embeddings, redes profundas, Redes Neurais Convolucionais (CNNs) e Recorrentes (RNNs), LSTM, GRU, GAN e modelos multimodais
- Pré-processamento de Texto em NLP: Limpeza, normalização, remoção de stop words, stemming e lematização
- Representação de Texto: N-grams, CBoW, TF-IDF, word embeddings (Word2Vec e GloVe) e document embeddings (Doc2Vec, BERT e ELMo)
- Modelagem de Tópicos: Latent Dirichlet Allocation (LDA) e Non-negative Matrix Factorization (NMF)
- Modelos de Linguagem: Tradicionais, redes neurais recorrentes, redes neurais convolucionais e transformers
- Tarefas Básicas em NLP: Classificação de texto, análise de sentimento, extração de informação (NER e REL), similaridade textual, sumarização, POS-tagging e tradução automática
- Python: Sintaxe básica, operadores, variáveis e estruturas de dados (dataframes, listas, matrizes, dicionários e conjuntos)
- Python: Estruturas de controle de fluxo, funções, escopo, métodos, paralelização de rotinas, serialização e desserialização
- Bibliotecas Python para Manipulação e Visualização: Pandas, NumPy, Matplotlib e Seaborn
- Bibliotecas Python para Modelagem: TensorFlow, Keras, PyTorch, Scikit-learn, XGBoost, NLTK, spaCy, huggingface, PySpark, Beautiful Soup e Streamlit
- Linguagem SQL: Conceitos introdutórios, comandos de consulta (inserção, atualização e exclusão) e análise de dados (funções de agregação, filtros, joins e subconsultas)
- Microsoft Power BI: Conexão e importação de dados, modelagem, medidas e colunas calculadas, visualizações, interações, relatórios e painéis
- Tipos de Visualizações e Gráficos: Tabela, barras, linhas, pizza, dispersão, histograma, área, boxplot, bolhas, radar, mapas cartográficos e mapa de calor
- Visualização de Dados: Princípios de design de gráficos efetivos, codificação visual, interatividade e acessibilidade
- Dashboards: Construção de interfaces e layout, escolha de designs, organização de elementos visuais, seleção de gráficos, interatividades, drill-downs e acessibilidade
- Storytelling com Dados: Construção de narrativas visuais, contextualização e componentes de um storytelling efetivo
- Governança de Dados (DMBOK): Conceitos, objetivos, técnicas de qualidade e integridade de dados e princípios de privacidade e proteção a dados
- Governança de IA: Conceitos, objetivos e gestão de riscos em IA
- Riscos e Vulnerabilidades em IA: Viés algorítmico, exposição de dados sensíveis, envenenamento de dados de treinamento, ataques adversariais, manipulação e roubo de modelos, ataque de inferência e alucinações
- Aplicação de IA Responsável: Definição, ética, transparência, justiça e equidade, responsabilização, segurança cibernética e compliance regulatório
Legislação
LEGISLAÇÃO
- Lei nº 13.709/2018 - Lei Geral de Proteção de Dados Pessoais (LGPD)
Dúvidas Frequentes
O que contém a apostila para Profissional Júnior Transpetro - Ciência de Dados?
A apostila contém 929 páginas com teoria completa e 3353 questões comentadas, cobrindo o conteúdo programático do edital para o cargo de Profissional Júnior Transpetro - Ciência de Dados no concurso Transpetro/BR.
Como recebo o material após a compra?
Após a confirmação do pagamento você recebe imediatamente o link para download dos arquivos em PDF no seu e-mail — sem esperar dias pela entrega.
Posso ver uma amostra antes de comprar?
Sim! A página da apostila tem uma amostra gratuita em PDF para você avaliar a qualidade do material antes de decidir.
A apostila está atualizada com o edital do Transpetro/BR?
Sim. O material é elaborado com base no edital mais recente do concurso Transpetro/BR, incluindo a legislação e o conteúdo programático vigentes.