Visualização científica de uma célula eucariótica humana translúcida sobre fundo preto, com núcleo, DNA, mitocôndrias e demais organelas iluminados por luz âmbar. Imagem usada como metáfora visual da abordagem computacional da D2DNA.

Record linkage inspirado pela genômica

Dados diferentes.
A mesma identidade.

Conecte registros da mesma pessoa entre bases, mesmo com erros de digitação, abreviações e informações incompletas. Da pesquisa à operação, com tecnologia inspirada na genômica.

Representação computacional inspirada no DNA. Nenhuma amostra genética é utilizada.

A narrativa da animação

  1. O nome muda. A pessoa, não.
  2. Transformamos diferenças em sequências comparáveis.
  3. Identificamos correspondências entre registros de bases diferentes.

Método nascido e validado em

  • USPDoutorado em Bioinformática
  • PeerJRevisado por pares · 2022
  • Pasteur-USPPlataforma Científica
  • Fiocruz AmazôniaCoautoria · Manaus
  • ITpSInstituto Todos pela Saúde
  • Albert EinsteinPesquisa sênior
  • InCor · HCConsultoria científica

O problema dos dados reais

Por que os registros da mesma pessoa não coincidem?

Record linkage é o processo de identificar registros que representam a mesma pessoa, entidade ou evento em bases diferentes, mesmo quando os dados apresentam variações ou inconsistências.

Bases construídas em épocas, sistemas e finalidades distintas raramente compartilham um identificador confiável. Quando é preciso reuni-las, as diferenças aparecem todas de uma vez.

Três registros sintéticos da mesma pessoa em bases diferentes. As diferenças entre eles são de abreviação, grafia, formato de data, acentuação e campos ausentes.
OrigemNomeNascimentoNome da mãeMunicípio
Base A · saúdeMARIA CLARA DE SOUZA14/03/1987ANA SOUZASÃO PAULO
Base B · educaçãoMARIA C. SOUSA1987-03-14ANA SOUSASAO PAULO
Base C · registro civilMARIA CLARA SOUZA14/03/87campo vazioS. PAULO
A mesma pessoa, três vezes. Nenhum dos campos bate exatamente, e não há um identificador comum para resolver a dúvida. Registros sintéticos.
  • Grafias que variam

    Erros, acentos e abreviações alteram a escrita.

  • Informações incompletas

    Datas inconsistentes e campos ausentes.

  • Cadastros repetidos

    A mesma pessoa ocupa vários registros.

  • Bases desconectadas

    Sistemas sem um identificador confiável em comum.

Demonstração conceitual

Duas grafias. Uma pessoa.

Uma ilustração simplificada do princípio: registros diferentes são codificados, alinhados e avaliados por similaridade. Os nomes abaixo são fictícios.

Base AMARIA CLARA DE SOUZA
Base BMARIA C. SOUSA

O registro da base A é MARIA CLARA DE SOUZA. O registro da base B é MARIA C. SOUSA.

Duas grafias do mesmo nome, vindas de bases diferentes.

1 / 4 · Registros

Demonstração conceitual simplificada. Não representa o algoritmo proprietário completo da D2DNA.

Tudo é processado no seu navegador. Nada é enviado, registrado ou armazenado.

Como funciona

Como identificamos registros
da mesma pessoa.

A abordagem reaproveita ferramentas criadas para comparar sequências genômicas, projetadas justamente para encontrar semelhança onde existe variação.

  1. Preparar

    Normalizar e organizar os campos de identificação relevantes de cada base.

    normalização01 / 05
  2. Codificar

    Representar cada registro como uma sequência de DNA in silico: uma representação computacional, sem qualquer material biológico.

    encoding · dna in silico02 / 05
  3. Alinhar

    Comparar as sequências com princípios e ferramentas de alinhamento inspirados na bioinformática.

    alignment03 / 05
  4. Classificar

    Avaliar o grau de similaridade e identificar as correspondências prováveis entre registros.

    score04 / 05
  5. Integrar

    Devolver resultados estruturados para análise e uso nos sistemas do cliente.

    integração05 / 05
O mesmo registro atravessando as cinco etapas. Exemplo ilustrativo com dados fictícios; o mapeamento de nucleotídeos mostrado é didático, não o da D2DNA.

Caso aplicado · Amazônia brasileira

Duas bases sem identificador em comum.
Uma descoberta de saúde pública.

Antes mesmo de o método ser publicado, ele já estava em uso: um estudo de coorte precisava cruzar a vigilância nacional de malária com registros clínicos hospitalares, e não havia chave que ligasse as duas bases.

Base A · vigilância nacional

SIVEP-Malária

2012 a 2020

Notificações de malária em todo o território nacional. Só no Amazonas, 15,5 milhões de exames no período.

Base B · registros clínicos

Fundação de Medicina Tropical Dr. Heitor Vieira Dourado

2012 a 2016

Triagem de HIV no hospital tropical de referência em Manaus: 42.121 pessoas triadas, 1.569 com resultado positivo.

alinhado por nome · data de nascimento · nome da mãe

Sem identificador único entre as bases, a correspondência foi feita pelos campos de identificação disponíveis. Cada base foi deduplicada antes do linkage, e só foram aceitos pares acima de um limiar de probabilidade de 0,7. Todos foram revisados manualmente para excluir homônimos, irmãos e duplicidades.

O que o cruzamento revelou

Pessoas HIV positivas tiveram 6,48× mais risco de contrair malária por Plasmodium vivax.

Risco relativo ajustado 6,48 (IC 95% de 5,37 a 7,83; P < 0,0001).

Até então quase não havia dados sobre essa associação: o que se sabia de coinfecção vinha do Plasmodium falciparum na África subsaariana. O achado só foi possível depois de cruzar as duas bases, e representa um desafio adicional na formulação de políticas públicas para pacientes com a doença.

Ler o estudo de coorte · Scientific Reports
  • 4anos de coorte
  • 1workstation comum
  • 0chaves em comum

O linkage foi executado com o Tucuxi-BLAST em uma estação de trabalho Linux (Intel Core i7-8700, 12 núcleos físicos, 32 GB de memória) comum, sem infraestrutura dedicada. Estudo conduzido por equipe de pesquisa multi-institucional com participação dos autores do método; resultados nas condições descritas na publicação.

Origem científica

Pesquisa e validação do método.

A abordagem da D2DNA nasceu de uma tese de doutorado em Bioinformática na Universidade de São Paulo e de um método publicado e revisado por pares.

  1. 2021

    Tese de doutorado de Deney Araújo, Universidade de São Paulo

    "Integração de bases de dados administrativos com ferramentas genômicas", defendida em julho de 2021 no Programa de Pós-Graduação Interunidades em Bioinformática da USP, sob orientação de Helder Takashi Imoto Nakaya.

    Ver tese na Biblioteca Digital da USP
  2. 2022

    Publicação revisada por pares na PeerJ

    "Tucuxi-BLAST: Enabling fast and accurate record linkage of large-scale health-related administrative databases through a DNA-encoded approach", publicado em 11 de julho de 2022 na PeerJ (10:e13507), sob licença aberta CC BY 4.0.

    Ler o artigo na PeerJ
  3. Hoje

    Da pesquisa à D2DNA

    A linha de pesquisa evoluiu para soluções aplicadas de integração de dados. A D2DNA leva esses princípios a projetos reais de record linkage, deduplicação e relacionamento de bases.

A ferramenta consegue relacionar o mesmo paciente em outra base porque trata as inconsistências como se fossem mutações no DNA.
Síntese do princípio descrito na publicação de 2022

O que o estudo demonstrou

  • Os campos de identificação de cada registro são codificados como sequências de DNA in silico.
  • O alinhamento entre as sequências é feito com o algoritmo BLASTn, criado para comparação genômica.
  • Os resultados do alinhamento são classificados para separar correspondências prováveis de coincidências.
  • A tolerância a erros de digitação e variações de grafia é uma consequência direta do alinhamento por similaridade.

Resultados do estudo publicado

Em experimentos descritos no estudo publicado em 2022, avaliando bases simuladas e bases administrativas brasileiras reais:

  • Método de referência5 dias e 7 h
  • Tucuxi-BLAST23 h
Tempo para completar o record linkage do maior conjunto simulado avaliado (200 mil registros), conforme o estudo publicado na PeerJ em 2022. Barras em escala. Resultado do experimento acadêmico descrito na publicação, não um parâmetro de serviço.
  • 5ferramentas comparadas

    Comparado a cinco ferramentas de record linkage existentes sobre um conjunto padrão-ouro derivado de bases de saúde reais, obteve a maior acurácia e velocidade entre elas.

  • 300 miregistros simulados

    A validação incluiu uma base simulada com registros de 300 milhões de indivíduos.

Estes são resultados do estudo acadêmico de 2022, obtidos nas condições descritas na publicação. Não constituem garantia de desempenho nem parâmetro de serviço para projetos atuais.

Soluções e serviços

Integração de bases, deduplicação e acesso por API.

Comece pelo seu desafio. Conheça a aplicação do método e o formato de trabalho adequado à sua operação.

Integração, codificação e execução: capacidades complementares, combinadas conforme o projeto.

Dois agrupamentos cristalinos translúcidos, à esquerda e à direita, unidos ao centro por uma ponte de luz âmbar que os funde numa estrutura contínua.
Integração e deduplicação de bases

Capacidade

Record Linkage

Rastrear a mesma pessoa em bases construídas por sistemas diferentes, mesmo sem identificador comum, e reduzir duplicidades dentro de uma mesma base.

O que entrega

  • Integração entre bases de origens distintas
  • Deduplicação de registros repetidos
  • Tolerância a erros de digitação e variações de grafia
Ficha técnica01 / 04
Entrega
Projeto conduzido pela equipe
Resolve
Integração + deduplicação
Base do método
Tucuxi-BLAST · 2022
Saída
Pares e clusters

A abordagem tem origem no Tucuxi-BLAST, a ferramenta inicial descrita na publicação de 2022.

Falar sobre Record Linkage

Projetos sob medida

Quando o desafio não cabe em um formato pronto, a equipe atua desde o diagnóstico: desenho da estratégia de linkage, definição de limiares, avaliação de qualidade e proteção dos dados envolvidos.

Descrever meu cenário

Gratuito para pesquisa acadêmica

Tucuxi para pesquisadores

A ferramenta que originou o método é disponibilizada sem custo para pesquisa acadêmica. Se seu trabalho depende de integrar bases e não de um contrato comercial, comece por aqui.

Solicitar acesso

Áreas de aplicação

Onde aplicar a integração de registros.

Contextos em que a integração de registros muda a qualidade da informação disponível para decidir.

  • Pesquisa

    Construir coortes e acompanhar indivíduos ao longo de múltiplas bases epidemiológicas.

  • Educação

    Relacionar trajetórias e registros educacionais mantidos em sistemas distintos.

  • Administração e registros públicos

    Integrar bases administrativas construídas em períodos e padrões diferentes.

  • Grandes volumes

    Operações que envolvem bases massivas, em que o custo computacional é parte central do problema.

Privacidade e responsabilidade

Como a codificação participa da proteção dos dados.

A codificação in silico introduz uma camada adicional de privacidade: durante etapas do processo, a comparação ocorre sobre sequências codificadas, e não sobre os campos originais em texto claro.

  • Camada adicional durante o linkage

    A codificação reduz a exposição direta dos campos de identificação nas etapas de comparação.

  • Governança continua necessária

    Nenhuma técnica substitui política de acesso, base legal, contrato e responsabilidade sobre dados sensíveis.

  • Controle de acesso

    O desenho de quem acessa o quê, e em qual etapa, entra no projeto desde o começo.

  • Decisões documentadas

    Critérios de classificação e limites de decisão precisam ser auditáveis por quem responde pela base.

Núcleo de dados âmbar, formado por fragmentos cristalinos compactados, envolvido por várias camadas concêntricas de membrana azul translúcida que o refratam e obscurecem parcialmente. Composição conceitual sobre proteção por organização em camadas.

O que DNA in silico não significa

  • Não analisamos o código genético das pessoas.
  • Não coletamos amostras biológicas.
  • Não armazenamos informações dentro de DNA físico.
  • Usamos uma representação computacional inspirada na genômica.

Equipe e competência

Quem desenvolve e aplica o método.

Uma equipe multidisciplinar que reúne bioinformática, desenvolvimento de software, análise de dados e pesquisa clínica.

Fundadores & liderança científica

  • Retrato de Deney Araújo

    Deney Araújo

    CEO e desenvolvedor

    PhD em Bioinformática (Instituto de Matemática e Estatística / USP). Pesquisador do Instituto Todos pela Saúde. Desenvolvedor do método de record linkage com dados codificados em DNA.

  • Retrato de Helder Nakaya

    Helder Nakaya

    Chief Scientific Officer

    PhD em Biologia de Sistemas. Professor Associado da Universidade de São Paulo e Pesquisador Sênior do Hospital Israelita Albert Einstein.

  • Retrato de Jorge Kalil

    Jorge Kalil

    Consultor sênior

    PhD em Imunologia. Médico e pesquisador do Instituto do Coração do Hospital das Clínicas.

Equipe técnica

  • Retrato de Joana Azevedo

    Joana Azevedo

    Bioinformata

    PhD em Bioinformática pela USP e mestra em Ciência da Saúde. Especialista em análise de dados genômicos e metagenômicos.

  • Retrato de Willian Lira

    Willian Lira

    Backend e análise de dados

    Formação em Mecatrônica e Biotecnologia. Experiência em automação industrial, segurança de bancos de dados, servidores Linux e redes.

  • Retrato de Janderson Caldas

    Janderson Caldas

    Frontend e DevOps

    Experiência em implementação de interfaces e otimização de pipelines de CI/CD, com JavaScript, React, Docker e Kubernetes.

Nossos parceiros

Instituições com quem trabalhamos.

As marcas pertencem às respectivas instituições e são exibidas apenas para identificá-las.

Perguntas frequentes

Perguntas sobre a tecnologia e os projetos.

Converse com a equipe

Conte quais bases você precisa integrar.

Selecione o objetivo e os detalhes que já conhece. Veja o que precisamos avaliar para discutir o projeto.

01 / Qual é o seu objetivo?

O que avaliar neste projeto

Identificar correspondências entre as bases

Precisamos entender quais campos permitem reconhecer a mesma pessoa em sistemas diferentes.

Informações para a conversa

  1. Quais campos as bases compartilham, como nome e data de nascimento?
  2. Existe um identificador comum? Ele está preenchido e é confiável?
  3. Como os pares encontrados serão usados e revisados?

Possível próximo passo

Um possível início é avaliar a estrutura das bases e definir critérios para testar a qualidade das correspondências.

Conversar com a equipe

As escolhas preparam uma mensagem. Você pode revisá-la no WhatsApp ou e-mail antes de enviar. Não inclua dados pessoais das bases.