Odontologia Digital
IA da USP em radiografia panorâmica: o que o estudo mostra sobre numerar dentes e detectar cárie
Um estudo da USP treinou duas redes neurais para numerar dentes e identificar cavidades em radiografias panorâmicas usando dados de pacientes brasileiros. Veja os números reportados, o que os próprios autores apontam como limite e o que isso muda (e não muda) na prática clínica agora.
Pesquisadores da Universidade de São Paulo (USP) treinaram e compararam duas redes neurais convolucionais para executar duas tarefas específicas em radiografias panorâmicas digitais: numerar os dentes conforme a notação da Federação Dentária Internacional (FDI) e identificar quais dentes apresentam cavidade de cárie. O trabalho, conduzido por grupos da Faculdade de Filosofia, Ciências e Letras de Ribeirão Preto (FFCLRP) e da Faculdade de Odontologia de Ribeirão Preto (FORP) da USP, foi publicado na revista PLOS Digital Health [1].
O estudo ganhou repercussão na imprensa brasileira em agosto de 2026 [2,3], mas o artigo científico já havia sido publicado em novembro de 2025 [1]. Essa diferença de datas importa: não se trata de uma pesquisa recém-concluída, e sim de um trabalho que já passou por revisão por pares há quase um ano antes de chegar ao noticiário.
O que exatamente foi testado
A equipe comparou duas arquiteturas de rede neural convolucional, Inception-v3 e InceptionResNet-v2, ambas pré-treinadas em um grande banco de imagens genéricas (ImageNet) e depois ajustadas para as tarefas odontológicas — uma técnica chamada transferência de aprendizado. Para numeração dentária, os modelos foram treinados com 935 radiografias panorâmicas de pacientes atendidos na FORP-USP entre 2014 e 2020, recortadas em 18.836 imagens individuais de dentes, além de radiografias públicas coletadas em 2023. Para a detecção de cárie, o treinamento usou 7.304 imagens de dentes, divididas igualmente entre dentes com cavidade e sem cavidade [1].
Um ponto que diferencia este trabalho da maior parte da literatura internacional sobre IA em radiografia panorâmica é a origem dos dados: o conjunto principal vem de uma população de pacientes brasileiros atendidos em um serviço universitário, não de bancos de imagem de outros países [1]. Isso não garante, por si só, que o desempenho se repita em qualquer clínica brasileira — mas reduz uma lacuna real, já que a maioria dos estudos publicados sobre o tema usa dados de outras populações.
Os números, com o contexto necessário para interpretá-los
Em qualquer estudo de IA diagnóstica, alguns números ajudam a entender o desempenho real: precisão (proporção de resultados positivos que estavam corretos), recall ou sensibilidade (proporção de casos verdadeiros que o modelo conseguiu identificar), especificidade (proporção de casos negativos corretamente descartados) e F1-score (uma média que equilibra precisão e recall). Nenhum desses números, isoladamente, deve ser lido como "a IA acerta X% das vezes" na prática clínica, porque o desempenho medido em um conjunto de teste específico não se transfere automaticamente para outra população ou outro aparelho de raio-X.
Para a numeração dentária, a rede InceptionResNet-v2 teve o melhor desempenho entre as duas testadas: precisão de 0,979, recall de 0,978, especificidade de 0,999 e F1-score de 0,978. A Inception-v3 ficou um pouco atrás, com F1-score de 0,919 [1]. Numerar dentes corretamente é uma tarefa mais restrita do que diagnosticar uma doença — o modelo precisa reconhecer a posição de uma estrutura visível, não interpretar um sinal de patologia — o que ajuda a explicar por que o desempenho foi tão alto nessa tarefa específica.
Para a detecção de cárie — classificar um dente como cavitado ou não cavitado —, a mesma rede (InceptionResNet-v2) teve desempenho um pouco mais modesto: precisão de 0,963, recall de 0,914, especificidade de 0,965 e F1-score de 0,937. A Inception-v3 teve F1-score de 0,910 na mesma tarefa [1]. A queda de desempenho entre as duas tarefas é esperada: identificar cárie exige distinguir um sinal patológico sutil, que pode variar em aparência, estágio e sobreposição com outras estruturas — uma tarefa mais difícil do que localizar a posição de um dente.
O que os próprios autores apontam como limite
O artigo original é explícito sobre as limitações do trabalho. O conjunto de dados usado é relativamente pequeno e desbalanceado entre as diferentes posições dentárias, o que pode afetar o desempenho em dentes menos representados nos dados de treino — os próprios autores relatam pior desempenho em terceiros molares e caninos. Os autores também não aplicaram técnicas sistemáticas de pré-processamento de imagem, como redução de ruído ou normalização, nem ponderação de classes para compensar o desbalanceamento. Os testes usaram validação cruzada — um método em que a base de dados é dividida em partes ("folds") e o modelo é treinado e testado repetidas vezes, trocando a cada rodada qual parte serve de teste, para checar se o resultado se mantém consistente. Neste estudo foram usadas apenas cinco dessas divisões, número reduzido que, segundo os próprios autores, limita a robustez estatística das comparações entre os dois modelos [1].
Outra limitação estrutural, não específica deste estudo: o trabalho usa exclusivamente radiografias panorâmicas, que têm sensibilidade menor do que radiografias intraorais para detectar lesões de cárie iniciais ou em superfícies proximais [1]. Isso significa que mesmo um modelo com bom desempenho sobre a radiografia panorâmica não substitui a indicação de outra modalidade de imagem quando a pergunta clínica exigir mais detalhe.
O que isso muda na prática, hoje
Nada neste estudo indica que a ferramenta esteja pronta para uso rotineiro em consultório. Trata-se de um trabalho de pesquisa, com dataset de tamanho moderado e validação interna — não um produto testado em múltiplos centros ou populações diferentes. Os próprios pesquisadores, em declarações à imprensa, enquadram o sistema como um possível apoio de "segunda opinião" ao diagnóstico, reforçando que a responsabilidade pela decisão clínica permanece do cirurgião-dentista e que nenhum sistema de IA é infalível [1,2,3].
Há também uma limitação menos técnica e mais prática: como a maioria dos modelos de deep learning, o sistema funciona como uma "caixa-preta" — é difícil explicar exatamente por que ele chegou a determinada classificação para um dente específico. Isso dificulta auditar um caso individual em que o modelo erre, e é uma razão adicional para tratar o resultado como um sinal a ser conferido, não como um veredito [2].
Perguntas que ainda faltam responder
O estudo não testou o modelo em radiografias de outros serviços, aparelhos ou populações fora da amostra usada no treino e teste — uma etapa chamada validação externa, essencial antes de qualquer uso clínico mais amplo [1]. Também não há, até o momento desta publicação, informação pública sobre se e quando a ferramenta ficará disponível para uso por clínicas fora do ambiente de pesquisa. Essas são as perguntas que devem orientar qualquer decisão de adoção, e não apenas os números de desempenho relatados no artigo.
Referências
Zancan BG, Carneiro JA, Martins CU, Tirapelli C, Capel CP, Costa ED, Gaêta-Araujo H, Baranauskas JA, Macedo AA. AI-powered precision in dental radiographic analysis using tailored CNNs for tooth numbering and cavity detection. PLOS Digital Health, 2025.
DOI: 10.1371/journal.pdig.0001074
Consultar referência 1 ↗USP desenvolve IA que ajuda dentistas a detectar cáries em radiografias. Olhar Digital, 2026.
Consultar referência 2 ↗USP desenvolve IA para identificar cárie em radiografias. CNN Brasil, 2026.
Consultar referência 3 ↗
TEMAS DESTE ARTIGO