Quero-Quero
Dados e continual pretraining em português brasileiro
Pipeline de pesquisa reprodutível para preparar seis corpora em português brasileiro e adaptar o Tucano 2 0.6B por continual pretraining.
- Problema:
- Preparar dados heterogêneos em escala e treinar modelos de linguagem com proveniência, privacidade e comparabilidade entre experimentos.
- Contribuição:
- Projetou e implementou validação, limpeza conservadora, deduplicação, tokenização, packing, shards verificáveis e treinamento retomável com avaliação de loss e perplexidade.
- Estado atual:
- Preparação dos seis datasets e pipeline de treino implementados; a execução científica completa depende dos derivados locais e da alocação no cluster.
Tecnologias: Python, PyTorch, Hugging Face Transformers, Parquet, Slurm, DDP, NCCL.
WackyWacky
Crawler experimental para construção controlada de corpus
Crawler web open source para exploração controlada, coleta de texto comprimido e observabilidade completa da execução.
- Problema:
- Coletar páginas recursivamente sem perder controle sobre domínios, idioma, ritmo de acesso, falhas e volume armazenado.
- Contribuição:
- Implementou trabalhadores concorrentes, filtros de domínio e idioma, limites de taxa e tentativas, persistência comprimida e telemetria de métricas, logs e traces.
- Estado atual:
- Crawler experimental funcional e publicado como open source.
Tecnologias: Python, Playwright, MySQL, Docker, OpenTelemetry, Grafana, Loki, Prometheus, Jaeger.
WackyWacky Analysis
Análise de corpus em memória externa
Pacote independente para caracterizar cópias imutáveis do corpus WackyWacky sem carregar dezenas de gigabytes na memória.
- Problema:
- Validar, deduplicar e caracterizar um grande corpus textual com resultados retomáveis e auditáveis em hardware limitado.
- Contribuição:
- Desenvolveu inventário, deduplicação exata, revisão de boilerplate, análise lexical e estrutural, checkpoints e geração determinística de tabelas e figuras.
- Estado atual:
- Pipeline e visão principal B_clean_v2 implementados; a execução integral ocorre na processadora dedicada.
Tecnologias: Python, Parquet, Zstandard, spaCy, Slurm.
Semantic Replace with Federated Learning
Privacidade e reprodução de dados pessoais em aprendizado federado
Pesquisa experimental sobre reprodução direcionada de perfis pessoais sintéticos e mitigação de vazamento em treinamento federado de modelos de linguagem.
- Problema:
- Medir se um cliente adversário aumenta a reprodução de dados sensíveis e comparar defesas sob condições federadas controladas.
- Contribuição:
- Implementou dados sintéticos, treinamento local, FedAvg, auditoria de extração, substituição semântica rotativa, DP-AdamW por conversa e pilotos retomáveis.
- Estado atual:
- Piloto de substituição semântica concluído e aprovado em duas seeds; execução científica do piloto refinado com privacidade diferencial ainda pendente.
Tecnologias: Python, PyTorch, Hugging Face Transformers, Opacus, Slurm.
Visual Algo
Demonstrações interativas de algoritmos
Coleção publicada de experiências visuais para explorar algoritmos, aprendizado de máquina e evolução neural diretamente no navegador.
- Problema:
- Tornar conceitos abstratos observáveis e manipuláveis em experiências didáticas sem instalação.
- Contribuição:
- Criou e mantém demos de K-Means, perceptron, veículos neurais evoluídos e simulação evolutiva determinística.
- Estado atual:
- Publicado no GitHub Pages com demonstrações disponíveis.
Tecnologias: JavaScript, HTML, CSS, p5.js, TensorFlow.js, Chart.js.
RP-Sim
Simulador de propagação de rádio
Ambiente open source para simular propagação de comunicação sem fio, com suporte a modelos de propagação, RSSI, BER, exportação de área de comunicação e visualização por demonstração interativa.
Tecnologias: JavaScript, p5.js, Mappa.js.
MCCD
Metodologia e datasets conversacionais
Metodologia para geração de datasets conversacionais naturais a partir de fóruns online e outras fontes de diálogo humano.
Miner-XenForo
Ferramenta de mineração de fóruns
Ferramenta para extrair e preparar dados conversacionais de fóruns para uso em datasets de Processamento de Linguagem Natural.
Tecnologias: Python.
Portuguese NLP dataset
Datasets para Processamento de Linguagem Natural em português
Agregação de conjuntos de dados novos ou adaptados para treinamento de modelos em português.
GGA
Biblioteca Python para algoritmos genéticos
Biblioteca open source para facilitar a criação e customização de algoritmos genéticos em Python.
Msim
Simulador de eventos
Simulador simples de eventos em Python.
Tecnologias: Python.
Satellite Image Processing
Processamento de imagens de satélite
Processamento de imagens dos satélites Landsat-8 e Sentinel-2 para apoiar a tomada de decisões de agricultores com imagens coloridas e NDVI.
Tecnologias: AWS, Python, GDAL, Rasterio, Pillow.
SCO3, Servidor Clickideia Offline 3.0
Projeto FAPESP
Projeto voltado a atualizações automáticas de conteúdo educacional por redes oportunísticas em escolas com acesso limitado ou inexistente à internet.