Engenheiro de Machine Learning focado em colocar modelos em produção e mantê-los confiáveis nesse processo.
Sobre Mim
Sou Engenheiro de Machine Learning, formado em Engenharia de Computação, focado em construir e implantar sistemas de machine learning. Minha experiência abrange ML clássico, deep learning e NLP, com ênfase em levar modelos da experimentação à produção.
Já trabalhei em saúde pública, pesquisa no setor automotivo e desenvolvimento internacional, construindo pipelines de dados, APIs e monitoramento para sistemas de ML do mundo real. Tenho interesse particular em MLOps e machine learning em produção. Fora do trabalho, jogo xadrez, contribuo com projetos open-source e gosto de longas caminhadas com meu cachorro.
Experiência Profissional
Trabalho de ML em produção em saúde, automotivo e desenvolvimento internacional
Engenheiro de Machine Learning
Out 2024 – Jan 2026- ▸Automatizei o workflow de OCR (OpenCV, Tesseract, PaddleOCR), reduzindo o tempo de processamento de 20 dias para 7 horas.
- ▸Construí pipelines de NLP (Kedro, DVC, MLflow) para classificação automática de laudos médicos, garantindo rastreabilidade total para auditoria.
- ▸Entreguei serviços FastAPI em Docker com MinIO como data lake/artifact store, e padronizei o ciclo de vida dos modelos com tracking e registry remoto no MLflow.
Cientista de Dados
Mai 2023 – Set 2024- ▸Desenvolvi modelos de ML (Scikit-learn, Pandas, NumPy) que contribuíram para um aumento de 18% na satisfação dos clientes.
- ▸Implementei pipelines de NLP (NLTK, spaCy, fastText, Word2Vec) para automatizar a extração de insights de texto.
- ▸Integrei modelos de ML em sistemas legados em C# e conduzi testes A/B para validar novas soluções contra o modelo vigente.
Pesquisador & Cientista de Dados
Mai 2023 – Abr 2024- ▸Analisei dados de performance de veículos elétricos (EV) com PySpark e MLlib, aplicando testes de hipótese e análise multivariada.
- ▸Desenvolvi modelos de regressão, classificação e clusterização sobre dados de telemetria em ambiente GCP (BigQuery, Vertex AI).
- ▸Apresentei resultados para lideranças internacionais, colaborando com times de engenharia e negócios na modelagem de features.
Estagiário de Analytics
Mai 2022 – Nov 2022- ▸Apoiei projetos internacionais de análise de dados com equipes multiculturais em uma agência de migração da ONU.
- ▸Construí pipelines de ETL (Pentaho, SQL, SQLAlchemy) e protótipos de API/dashboard (FastAPI, Streamlit) para relatórios a stakeholders.
- ▸Gerenciei dados em Azure e S3, e contribuí com dashboards em Power BI para apoio à decisão.
Skills e Tecnologias
Ferramentas que uso de verdade, agrupadas por onde aparecem no trabalho acima
Linguagens & Frameworks
Python, SQL, C#, Pandas, NumPy, Scikit-learn, TensorFlow, PyTorch, FastAPI
MLOps & Cloud
Docker, MLflow, DVC, Kedro, Airflow, Spark, AWS, GCP, Azure
Bancos de Dados & Visualização
PostgreSQL, MongoDB, Matplotlib, Seaborn, Plotly, Power BI
Projetos em Destaque
Alguns dos projetos que desenvolvi
AI Hiring Matcher
Matcher de currículos para vagas que audita o próprio rótulo de treinamento em busca de viés antes de confiar nele. Encontrou viés de gênero de até 89 pontos percentuais dependendo do cargo, e é projetado para não reproduzi-lo. Avaliado como recuperação em conjunto fechado de 51 cargos conhecidos (88,2% de Recall@5), sem pretensão de generalizar para vagas novas. Stack de MLOps totalmente local (DVC, MLflow, Evidently), sem precisar de conta em nuvem.
CiteRAG
Sistema de RAG self-hosted para documentação técnica. Se o modelo não conseguir embasar uma resposta com uma citação, ele se recusa a responder em vez de arriscar. Um design fail-closed que a maioria dos demos de RAG ignora. Busca híbrida, reranking por cross-encoder, inferência 100% local.
Pipeline de Benchmark de OCR
Pipeline containerizado para comparar engines de OCR (Tesseract, EasyOCR, PaddleOCR) em documentos escaneados, medindo precisão real (CER/WER, extração de campos, localização por IoU) contra um gabarito, não só tempo. Novos engines se plugam por uma única interface; vem com dados de exemplo e modo offline completo, rodando do zero sem configuração externa.
Previsão de Demanda de Corridas
Previsão de demanda de corridas reconstruída de forma honesta com dados públicos, em vez de reutilizar o dataset de uma entrevista de emprego. Encontrou uma divisão treino/teste ingênua inflando o erro de avaliação em 4x, e corrigiu mais dois bugs de vazamento de dados ao transformar o notebook em um serviço FastAPI real.
Entre em Contato
Aberto a vagas efetivas, freelance e colaborações