Matheus Ferraroni Sanches

CTO e diretor de P&D do Grupo Orion Sistemas Agrícolas, onde lidera o desenvolvimento de novas máquinas, equipamentos agrícolas, soluções tecnológicas e plataformas de dados geoespaciais para apoio à tomada de decisão no campo. É professor dos cursos de Ciência da Computação e Inteligência Artificial na Unimar e doutorando em Ciência da Computação pela Unicamp.

Processamento de Linguagem Natural Agtech Privacidade e segurança em LLMs Aprendizado Federado Otimização Sensoriamento remoto Redes veiculares Comunicação sem fio Pesquisa e Desenvolvimento (P&D) Inovação tecnológica Agricultura de precisão Dados geoespaciais Transformação digital no agronegócio

Histórico profissional

Diretor de Tecnologia (CTO) e Diretor de P&D, Grupo Orion Sistemas Agrícolas

Jun/2025, atual

Responsável pelas diretorias de Tecnologia e Pesquisa & Desenvolvimento do Grupo Orion Sistemas Agrícolas, pelo CINTEC e pela tecnologia da CYGNI AgroScience. Lidera a estratégia tecnológica e o desenvolvimento de máquinas, equipamentos agrícolas, soluções digitais e plataformas de dados geoespaciais. Também colabora tecnicamente com os experimentos do laboratório de biologia, sem exercer a direção do laboratório.

Professor, Universidade de Marília (UNIMAR)

Jan/2025, atual

Professor universitário nas áreas de Inteligência Artificial, Ciência da Computação e Sistemas de Informação. Atua em disciplinas relacionadas a Inteligência Artificial, aprendizado de máquina, algoritmos e estruturas de dados, conectando fundamentos teóricos e aplicações práticas para o desenvolvimento de soluções tecnológicas inovadoras.

Diretor de Tecnologia (CTO), CYGNI AgroScience

Set/2020 – Jun/2025

Responsável pela estratégia tecnológica, arquitetura de software e liderança das equipes de desenvolvimento, conduziu a evolução de plataformas de sensoriamento remoto e análise geoespacial baseadas em imagens de satélite. As melhorias reduziram custos em 10% e duplicaram a velocidade de processamento.

Experiências anteriores selecionadas

  • SumUp · Engenheiro de Software Sênior · Jun/2022 – Jun/2025

    Entregou iniciativas de engenharia que geraram economia anual de milhões de dólares.

  • CI&T Software · Cientista de Dados/Pesquisador · Fev/2021 – Set/2022

    Desenvolveu uma solução de ciência de dados que melhorou a acurácia em 15%.

  • CYGNI AgroScience · Líder técnico · Dez/2019 – Ago/2020

  • Clickideia Tecnologia Educacional · Desenvolvedor de Software — Bolsista FAPESP (Treinamento Técnico) · Dez/2018 – Nov/2019

  • CYGNI AgroScience · Gerente de TI · Ago/2016 – Nov/2018

  • Centro Universitário Eurípides de Marília, UNIVEM · Pesquisador CNPq · Jan/2015 – Jul/2016

  • FBM · Professor convidado — Python para Finanças (18 horas) · 2024

Histórico acadêmico

Doutorado em Ciência da Computação

2020, em andamento

Universidade Estadual de Campinas, UNICAMP. Orientador: Leandro Aparecido Villas.

Pesquisa: Geração e Adaptação de Conjuntos de Dados Conversacionais para Modelos de Linguagem com Mitigação de Vazamento em Aprendizado Federado. Defesa agendada para 26 de outubro de 2026; curso em andamento.

Mestrado em Ciência da Computação

2018 a 2020

Universidade Estadual de Campinas, UNICAMP.

Trabalho acadêmico

Alocação de RoadSide Units Ciente de Obstáculos e Diferentes Modelos de Propagação de Sinal

Defesa:
27 de abril de 2020
Orientador:
Leandro Aparecido Villas
Banca examinadora:
Lucas Francisco Wanner e Roberto Sadao Yokoyama

Graduação em Ciência da Computação

2014 a 2017

Centro Universitário Eurípides de Marília, UNIVEM.

Trabalho acadêmico

Processamento e Entendimento de Linguagem Natural no Gerenciamento de Emergências para Obtenção de Consciência Situacional

Defesa:
27 de novembro de 2017
Orientador:
Leonardo Castro Botega
Banca examinadora:
Fabio Piola Navarro e Guilherme Rodrigues Bilar

Habilidades

  • Programação · Python, PHP, JavaScript, Elixir, C++, Go
  • Ferramentas · Git, Docker, Google Maps JS, Jupyter, Scikit-learn, NumPy, Pandas, Matplotlib, Seaborn, NLTK, DBT
  • Nuvem AWS · Lambda, EC2, S3, DynamoDB, CodeCommit, Elastic Beanstalk, EFS, RDS, API Gateway
  • Bancos de dados · SQL, NoSQL, DynamoDB, PostgreSQL, Snowflake
  • Idiomas · Português nativo · Inglês fluente
  • Competências interpessoais · Diligente, aprendizado rápido, proativo, colaborativo, pensamento crítico

Publicações selecionadas

2023

Automatic Extraction of Conversation Flows from Human Dialogues: Understanding Their Impact to Refine NLP Models

SN Computer Science. Trabalho sobre extração automática de fluxos conversacionais a partir de diálogos humanos para refinamento de modelos de Processamento de Linguagem Natural.

DOI: 10.1007/s42979-023-02148-7

Curricular Transfer Learning for Sentence Encoded Tasks

Preprint no arXiv. Estudo sobre aprendizado curricular para adaptação gradual entre distribuições em tarefas com sentenças codificadas.

arXiv: 2308.01849

2022

MCCD: Generating Human Natural Language Conversational Datasets

ICEIS 2022. Metodologia para geração de datasets conversacionais multi-turno e multiusuário a partir de fóruns online.

DOI: 10.5220/0011077400003179

Textual Datasets For Portuguese-Brazilian Language Models

Dataset Showcase Workshop, SBC. Apresentação de datasets textuais para modelos de linguagem em português brasileiro.

DOI: 10.5753/dsw.2022.224294

2021

EFIS: Ecological Fuel-consumption Intelligent System

DCOSS 2021. Sistema inteligente que combina controlador fuzzy e rede neural para recomendar velocidade instantânea e reduzir o consumo de combustível usando características do veículo e da rodovia.

DOI: 10.1109/DCOSS52077.2021.00032

2020

RP-Sim: Radio Propagation Simulator

SBRC Companion 2020

DOI: 10.5753/sbrc_estendido.2020.12395

2019

Genetic Algorithm for the Maximum Coverage Location Problem Applied to Medical Emergency

SBPO 2019. Algoritmo genético para selecionar locais de espera de veículos de emergência considerando informações de trânsito; trabalho premiado com o 2º lugar no Prêmio Roberto Diéguez Galvão.

DOI: 10.59254/sbpo-2019-106784

Projetos

Quero-Quero

Dados e continual pretraining em português brasileiro

Pipeline de pesquisa reprodutível para preparar seis corpora em português brasileiro e adaptar o Tucano 2 0.6B por continual pretraining.

Problema:
Preparar dados heterogêneos em escala e treinar modelos de linguagem com proveniência, privacidade e comparabilidade entre experimentos.
Contribuição:
Projetou e implementou validação, limpeza conservadora, deduplicação, tokenização, packing, shards verificáveis e treinamento retomável com avaliação de loss e perplexidade.
Estado atual:
Preparação dos seis datasets e pipeline de treino implementados; a execução científica completa depende dos derivados locais e da alocação no cluster.

Tecnologias: Python, PyTorch, Hugging Face Transformers, Parquet, Slurm, DDP, NCCL.

WackyWacky

Crawler experimental para construção controlada de corpus

Crawler web open source para exploração controlada, coleta de texto comprimido e observabilidade completa da execução.

Problema:
Coletar páginas recursivamente sem perder controle sobre domínios, idioma, ritmo de acesso, falhas e volume armazenado.
Contribuição:
Implementou trabalhadores concorrentes, filtros de domínio e idioma, limites de taxa e tentativas, persistência comprimida e telemetria de métricas, logs e traces.
Estado atual:
Crawler experimental funcional e publicado como open source.

Tecnologias: Python, Playwright, MySQL, Docker, OpenTelemetry, Grafana, Loki, Prometheus, Jaeger.

WackyWacky Analysis

Análise de corpus em memória externa

Pacote independente para caracterizar cópias imutáveis do corpus WackyWacky sem carregar dezenas de gigabytes na memória.

Problema:
Validar, deduplicar e caracterizar um grande corpus textual com resultados retomáveis e auditáveis em hardware limitado.
Contribuição:
Desenvolveu inventário, deduplicação exata, revisão de boilerplate, análise lexical e estrutural, checkpoints e geração determinística de tabelas e figuras.
Estado atual:
Pipeline e visão principal B_clean_v2 implementados; a execução integral ocorre na processadora dedicada.

Tecnologias: Python, Parquet, Zstandard, spaCy, Slurm.

Semantic Replace with Federated Learning

Privacidade e reprodução de dados pessoais em aprendizado federado

Pesquisa experimental sobre reprodução direcionada de perfis pessoais sintéticos e mitigação de vazamento em treinamento federado de modelos de linguagem.

Problema:
Medir se um cliente adversário aumenta a reprodução de dados sensíveis e comparar defesas sob condições federadas controladas.
Contribuição:
Implementou dados sintéticos, treinamento local, FedAvg, auditoria de extração, substituição semântica rotativa, DP-AdamW por conversa e pilotos retomáveis.
Estado atual:
Piloto de substituição semântica concluído e aprovado em duas seeds; execução científica do piloto refinado com privacidade diferencial ainda pendente.

Tecnologias: Python, PyTorch, Hugging Face Transformers, Opacus, Slurm.

Visual Algo

Demonstrações interativas de algoritmos

Coleção publicada de experiências visuais para explorar algoritmos, aprendizado de máquina e evolução neural diretamente no navegador.

Problema:
Tornar conceitos abstratos observáveis e manipuláveis em experiências didáticas sem instalação.
Contribuição:
Criou e mantém demos de K-Means, perceptron, veículos neurais evoluídos e simulação evolutiva determinística.
Estado atual:
Publicado no GitHub Pages com demonstrações disponíveis.

Tecnologias: JavaScript, HTML, CSS, p5.js, TensorFlow.js, Chart.js.

RP-Sim

Simulador de propagação de rádio

Ambiente open source para simular propagação de comunicação sem fio, com suporte a modelos de propagação, RSSI, BER, exportação de área de comunicação e visualização por demonstração interativa.

Tecnologias: JavaScript, p5.js, Mappa.js.

MCCD

Metodologia e datasets conversacionais

Metodologia para geração de datasets conversacionais naturais a partir de fóruns online e outras fontes de diálogo humano.

Miner-XenForo

Ferramenta de mineração de fóruns

Ferramenta para extrair e preparar dados conversacionais de fóruns para uso em datasets de Processamento de Linguagem Natural.

Tecnologias: Python.

Portuguese NLP dataset

Datasets para Processamento de Linguagem Natural em português

Agregação de conjuntos de dados novos ou adaptados para treinamento de modelos em português.

GGA

Biblioteca Python para algoritmos genéticos

Biblioteca open source para facilitar a criação e customização de algoritmos genéticos em Python.

Msim

Simulador de eventos

Simulador simples de eventos em Python.

Tecnologias: Python.

Satellite Image Processing

Processamento de imagens de satélite

Processamento de imagens dos satélites Landsat-8 e Sentinel-2 para apoiar a tomada de decisões de agricultores com imagens coloridas e NDVI.

Tecnologias: AWS, Python, GDAL, Rasterio, Pillow.

SCO3, Servidor Clickideia Offline 3.0

Projeto FAPESP

Projeto voltado a atualizações automáticas de conteúdo educacional por redes oportunísticas em escolas com acesso limitado ou inexistente à internet.

Prêmios e reconhecimentos

2022

Best Paper Award, ICEIS 2022

Trabalho: MCCD: Generating Human Natural Language Conversational Datasets.

2019

2º lugar no Prêmio Roberto Diéguez Galvão, SBPO 2019

Trabalho: Genetic Algorithm for the Maximum Coverage Location Problem Applied to Medical Emergency.

  • 2025: Destaque Profissional por Iniciativa Criativa e Inovadora · Orion Sistemas Agrícolas.
  • 2016: Destaque Profissional por Iniciativa Criativa e Inovadora · CYGNI AgroCiência.
  • 2014: Terceiro colocado na fase regional de programação · Sociedade Brasileira de Computação.
  • 2013: Primeiro colocado na olimpíada de informática para alunos do ensino médio promovida pelo UNIVEM.