Array de Diversidade Global e Arrays Infinium: Genotipagem de Alto Rendimento para Genómica Humana e Agrícola
Arrays de Conteúdo Fixo — O Cavalo de Batalha do Genotipagem em Grande Escala
As arrays SNP de conteúdo fixo ocupam um nicho distinto no panorama da tecnologia de genotipagem que nem o sequenciamento de genoma completo nem o sequenciamento de representação reduzida conseguiram substituir — e compreender o porquê revela a lógica que deve orientar as decisões de seleção de plataformas para instalações centrais e programas de melhoramento.
A plataforma Illumina Infinium BeadChip é a tecnologia dominante neste espaço. Cada BeadChip é uma pastilha de sílica gravada com micro-poços contendo esferas derivatizadas com oligonucleotídeos, cada esfera revestida com dezenas de milhares de cópias de uma sonda específica de locus de 50-mer. Duas químicas de ensaio coexistem: o Infinium I utiliza dois tipos de esferas por SNP (uma por alelo) e discrimina alelos por extensão de base única com didesoxirribonucleotídeos rotulados diferencialmente; o Infinium II utiliza um único tipo de esfera por SNP com coloração a duas cores após a extensão, trocando taxas de chamada ligeiramente mais baixas por uma maior densidade de multiplexação. Um único BeadChip processa 8, 24 ou 48 amostras, dependendo do formato da matriz, com o número de marcadores por amostra variando de aproximadamente 50.000 em matrizes agrícolas de baixa densidade a quase 2 milhões na Global Diversity Array com conteúdo PGx melhorado.
O lançamento da química Infinium EX em meados de 2025 reduziu os requisitos de entrada de DNA e encurtou o tempo de processamento em comparação com a química Infinium HD legado. Os produtos com tecnologia EX incluem o Global Screening Array v4 (GSA v4, 48 amostras por chip, ~650.000 marcadores com até 50.000 slots personalizados) e o Global Clinical Research Array (GCRA, 24 amostras por chip, ~1,2 milhões de marcadores curados a partir de bases de dados de pesquisa líderes, incluindo ClinVar, PharmGKB e ClinGen). Ambos têm variantes de Farmacogenética (PGx) aprimoradas com amplificação de genes direcionada para loci desafiadores, como CYP2D6 e CYP2B6, onde a interferência de pseudogenes complica a genotipagem padrão.
A vantagem fundamental das matrizes de conteúdo fixo — e a razão pela qual persistem apesar da diminuição do custo de sequenciação — é a consistência dos dados. Cada amostra analisada em um determinado design de matriz é interrogada exatamente no mesmo conjunto de marcadores, produzindo chamadas de genótipo que são diretamente comparáveis entre lotes, laboratórios e anos, sem necessidade de alinhamento de imputação ou correção de efeito de lote. Para uma instalação central que processa amostras de um estudo de coorte longitudinal ao longo de vários anos, ou um programa de melhoramento que acumula dados de genótipo ao longo de gerações de candidatos à seleção, essa comparabilidade não é uma conveniência — é uma exigência operacional. Um genótipo em rs429358 em um GDA realizado em 2025 é diretamente comparável a um genótipo no mesmo SNP em um GDA realizado em 2028, sem etapa de imputação, sem dependência de painel de referência e sem confundidores de efeito de lote a modelar. Para uma visão mais ampla do panorama da tecnologia de genotipagem, incluindo abordagens baseadas em sequenciação, como GBS e ddRAD-seq, consulte a CD Genomics. Serviços de Genotipagem e Diversidade Genética visão geral.
Figura 1: Tecnologia Infinium BeadChip — Da DNA a Chamadas de Genótipo através da Extensão de Base Única
Arrays de Genotipagem Humana — GDA e Seus Derivados
A Infinium Global Diversity Array (GDA) é a atual plataforma de genotipagem humana de referência, contendo aproximadamente 1,8 milhões de marcadores na configuração base e expansível para aproximadamente 2 milhões com módulos de conteúdo adicional. A estrutura de SNP foi projetada utilizando dados de sequenciamento de genoma completo do Consórcio sobre Asma entre Populações de Ancestria Africana nas Américas (CAAPA) e do estudo de Arquitetura Populacional utilizando Genómica e Epidemiologia (PAGE) — mais de 1.000 genomas completos de ancestria africana informaram a seleção de marcadores, abordando o persistente viés eurocêntrico que limitava o desempenho de plataformas anteriores em populações não europeias. A GDA foi selecionada como a plataforma de genotipagem para o programa de medicina de precisão All of Us do NIH, que por si só representa um dos maiores compromissos de genotipagem em plataforma única na história.
O ecossistema GDA expandiu-se através de complementos de conteúdo de reforço — pools de beads secundários fabricados no mesmo BeadChip que suplementam o conjunto de marcadores central com conteúdo específico de domínio. O reforço Enhanced PGx adiciona aproximadamente 108.000 marcadores cobrindo mais de 44.000 variantes relacionadas com ADME e 2.000 alvos farmacogenéticos em mais de 1.700 alelos estrela, com amplificação de genes direcionada para CYP2D6 para desambiguar a interferência de pseudogenes. O reforço Polygenic Risk Score Content (v1.0) adiciona marcadores selecionados para a determinação de PRS panétnicos, elevando o número total de marcadores para aproximadamente 2 milhões. O reforço Carrier Screening Content (v2.0) adiciona aproximadamente 45.000 marcadores em mais de 600 genes clinicamente significativos. O reforço Cytogenetics otimiza a cobertura para deteção de CNV com sondas direcionadas a mais de 4.800 genes clinicamente relevantes. Uma instalação central que oferece o GDA pode configurar a pilha de reforços para corresponder aos programas de pesquisa que serve — PGx para uma coorte de farmacogenómica, PRS para um estudo de saúde populacional, Citogenética para um registo de distúrbios do desenvolvimento — sem alterar a plataforma base, a cadeia de fornecimento de consumíveis ou o pipeline de análise.
O GSA v4, alimentado pela química Infinium EX, serve um nicho diferente: maior rendimento (48 amostras por BeadChip) a um custo por marcador mais baixo (~650.000 marcadores) com capacidade de adição personalizada, tornando-o a escolha económica para projetos em escala de biobanco onde o custo por amostra domina a seleção da plataforma. O Asian Screening Array (ASA) e o NeuroBooster Array (NBA) — este último construído sobre a base do GDA com aproximadamente 95.000 marcadores específicos de doenças neurológicas — ilustram a adaptabilidade da plataforma: o mesmo processo de fabrico de BeadChip, o mesmo leitor iScan, o mesmo software de análise GenomeStudio, mas conteúdo biológico radicalmente diferente ajustado a populações e áreas de doenças específicas.
Quando deve um estudo de genética humana optar por um array em vez de sequenciação? A resposta depende de três variáveis: se os marcadores de interesse são conhecidos de antemão, se as amostras serão recolhidas e analisadas ao longo de um período prolongado, e se o orçamento favorece o custo por amostra em grande escala ou o conteúdo informativo por marcador. Um estudo que precisa genotipar 10.000 amostras a um conjunto definido de 650.000 SNPs para cálculo de PRS, com amostras a chegar ao longo de três anos, é um projeto de array. Um estudo que precisa descobrir variantes raras novas em 500 amostras com um fenótipo específico é um projeto de sequenciação. O ponto de crossover de custo — o número de amostras acima do qual os arrays se tornam mais baratos por unidade de informação genética útil do que a sequenciação — depende da profundidade de sequenciação, densidade do array e do painel de referência de imputação disponível, mas como um marco prático: a preços atuais, um GWAS baseado em array em 5.000 amostras custa menos de 0,5× lcWGS na mesma coorte, e produz chamadas de genótipo em marcadores conhecidos e bem validados, sem a incerteza de imputação que acompanha os genótipos de sequenciação de baixa cobertura.
Um exemplo concreto ilustra a lógica de configuração do booster na prática. Um hospital de investigação que está a conduzir uma coorte de farmacogenómica com 3.000 pacientes em terapia antidepressiva necessita de dados SNP a nível genómico para estratificação populacional e variantes PGx direcionadas para a previsão do estado de metabolização CYP2D6 e CYP2C19. Executar a GDA base seguida de um painel de genotipagem direcionado separado para variantes PGx adiciona custo por amostra e um passo de fusão de dados. Executar a GDA com o booster Enhanced PGx — um único fluxo de trabalho BeadChip que fornece 1,93 milhões de marcadores, incluindo todo o conteúdo PGx necessário — elimina o passo de fusão e reduz o custo total por amostra em aproximadamente 25 a 35 por cento em comparação com a abordagem de duas plataformas. A decisão sobre o booster não diz respeito a saber se o conteúdo existe; trata-se de saber se o custo incremental por amostra do booster é inferior ao custo de executar um ensaio separado para os mesmos marcadores — um cálculo que depende do número de amostras, do tamanho do conteúdo do booster em relação a um painel direcionado autónomo e do custo de pessoal para a fusão de dados de duas plataformas. Serviços de microarranjos SNP o apoio a toda a família GDA com configuração de reforço e chamada de genótipos baseada no GenomeStudio está disponível.
Figura 2: Arrays de Genotipagem Humana vs. Agrícola — Densidade de Marcadores, Formato de Amostra e Domínios de Aplicação
Arrays Agrícolas — Genotipagem Específica de Espécies em Grande Escala
Os arrays de genotipagem agrícola resolvem um problema fundamentalmente diferente dos arrays humanos. Os arrays humanos são projetados para capturar a variação comum a nível populacional para GWAS e PRS de traços complexos — os marcadores são selecionados para identificar blocos de haplótipos em diversas ancestrias. Os arrays agrícolas são projetados para previsão genómica: estimar valores de reprodução a partir de genótipos de marcadores em todo o genoma, onde o objetivo não é identificar variantes causais, mas capturar com precisão as relações em todo o genoma entre os candidatos à seleção. Esta diferença de propósito orienta cada escolha de design.
As matrizes comerciais específicas para espécies incluem o BovineSNP50 (aproximadamente 50.000 marcadores), BovineHD (aproximadamente 777.000 marcadores), PorcineSNP60 (aproximadamente 65.000 marcadores), MaizeSNP50 (aproximadamente 50.000 marcadores) e várias matrizes de trigo que variam de 9.000 a 80.000 marcadores, dependendo do design do consórcio. A densidade de marcadores nas matrizes agrícolas é consistentemente inferior à das matrizes humanas para o mesmo nível de custo, uma vez que as espécies agrícolas não beneficiaram dos enormes investimentos em painéis de referência (1000 Genomes, TOPMed, gnomAD) que possibilitaram a otimização das matrizes humanas. As matrizes agrícolas são projetadas por consórcios — o USDA, a Universidade de Wageningen, o Centro Internacional de Melhoramento do Milho e do Trigo (CIMMYT) e vários programas nacionais de melhoramento — e os marcadores refletem as prioridades desses consórcios: cobertura genómica uniforme para previsão genómica, inclusão de variantes funcionais conhecidas (genes de resistência a doenças, QTLs principais, SNPs de parentesco) e compatibilidade entre raças, linhagens e populações dentro de uma espécie.
Um desenvolvimento notável em 2025 é o array multiespécies IMAGE001, um painel de 10.000 SNPs que abrange seis espécies de gado (gado, ovelhas, cabras, cavalos, porcos e galinhas) num único formato BeadChip. Projetado especificamente para coleções de bancos de genes, o IMAGE001 inclui variantes funcionais, marcadores de DNA mitocondrial, marcadores de cromossomos sexuais e SNPs relacionados a doenças e características. Para um banco de genes que gere material criopreservado em várias espécies de gado, o IMAGE001 substitui seis fluxos de trabalho de genotipagem específicos de espécies por um — um avanço prático que reduz custos, simplifica a logística laboratorial e padroniza o controlo de qualidade entre espécies. Este é o tipo de inovação que importa a uma instalação central, mas que é invisível para a maioria dos leitores de revistas científicas.
A seleção genómica — a principal aplicação de arrays de SNP agrícolas — utiliza marcadores genómicos para prever valores de melhoramento sem fenotipar cada indivíduo. O GBLUP (predição linear não tendenciosa genómica) continua a ser o padrão da indústria pelo seu equilíbrio entre precisão e eficiência computacional, enquanto métodos bayesianos (BayesA, BayesB, BayesR) e estruturas emergentes de aprendizagem profunda (Gsformer, uma arquitetura CNN com autoatenção publicada em 2026) oferecem uma precisão incrementalmente superior a um custo computacional significativamente mais elevado. O parâmetro chave para os utilizadores de arrays não é o algoritmo de predição específico, mas a densidade de marcadores: a precisão da predição atinge um platô a um número de marcadores dependente da espécie e do caráter, e adicionar marcadores além desse ponto de saturação custa dinheiro sem melhorar as decisões de seleção. Para gado leiteiro, a precisão estabiliza em aproximadamente 50.000 a 80.000 marcadores; para culturas altamente diversas com rápida degradação de LD, como o milho, 10.000 a 30.000 marcadores podem ser adequados. Uma instalação central que aconselha um programa de melhoramento deve recomendar o array de menor densidade que atinja os objetivos de precisão do programa, e não o array de maior densidade que o orçamento possa suportar.
A retrocruzamento assistido por marcadores — utilizando um pequeno conjunto de marcadores diagnósticos para rastrear QTLs ou transgenes conhecidos através de gerações de retrocruzamento — representa o extremo oposto do espectro de genotipagem agrícola: poucos marcadores, muitas amostras, rápida resposta. Para 1 a 10 marcadores em milhares de amostras, ensaios direcionados (KASP ou TaqMan, discutidos no nosso artigo sobre Serviços de Genotipagem de Microssatélites e SNPs) são mais rentáveis do que executar um array de 50.000 SNPs e descartar 49.990 genótipos por amostra.
Figura 3: Matriz de Decisão de Tecnologia de Genotipagem — Arrays vs. GBS vs. lcWGS em função do Tamanho da Amostra e Requisitos de Marcadores
Design de Array Personalizado — Quando o Padrão Não É Suficiente
Os arrays SNP de conteúdo fixo descritos acima são produtos de consórcios, projetados para espécies bem financiadas com grandes comunidades de utilizadores. Um geneticista de plantas que trabalha com o carvalho branco europeu, um ecólogo que estuda uma espécie de peixe não modelo, ou um melhorador que desenvolve uma nova variedade de cultura pode descobrir que não existe nenhum array comercial para a sua espécie — ou que os arrays existentes foram projetados para populações geneticamente distantes do seu material de estudo e apresentam um desempenho fraco devido ao viés de determinação de SNPs. O design de arrays personalizados preenche esta lacuna, mas o caminho desde um conjunto de SNPs candidatos até um BeadChip validado e pronto para produção é mais exigente do que o fluxo de trabalho de arrays comerciais.
O ciclo de design de arrays personalizados procede em quatro etapas. Etapa 1 — Descoberta de SNPs — utiliza tipicamente re-sequenciamento de genoma completo ou sequenciamento de representação reduzida (GBS, ddRAD-seq) de 50 a 200 indivíduos que representam as populações-alvo para identificar loci polimórficos. Etapa 2 — Seleção de SNPs e pontuação in silico — filtra SNPs candidatos através da ferramenta de design de ensaios (ADT) proprietária da Illumina, que pontua cada SNP com base no desempenho previsto do ensaio Infinium, considerando a singularidade da sequência flanqueadora, o conteúdo de GC e a presença de variantes secundárias na região de ligação da sonda. SNPs que recebem uma pontuação ADT abaixo de 0,6 são tipicamente excluídos, pois é improvável que produzam clusters de genótipos confiáveis, independentemente de quão bem projetado esteja o restante do ensaio. O processo de pontuação ADT não é um filtro de passagem única. Um fluxo de trabalho comum de instalação central itera: submeter a lista completa de SNPs candidatos, receber pontuações ADT, remover SNPs com pontuação abaixo de 0,4, depois para SNPs com pontuação de 0,4 a 0,6 examinar a sequência flanqueadora em busca de variantes secundárias dentro de 60 pb do SNP alvo que podem ser evitadas ao deslocar a janela de design da sonda, re-submeter as sequências de sondas ajustadas para nova pontuação e reter SNPs que melhoram para 0,6 ou acima na segunda passagem. Este passo de resgate iterativo recupera de 10 a 15 por cento dos SNPs que seriam descartados por um limiar ADT de passagem única, o que é significativo quando o pool inicial de candidatos é limitado — uma situação comum em espécies não-modelo onde a descoberta inicial de SNPs resulta em 20.000 a 40.000 variantes, em vez das mais de 100.000 típicas de organismos modelo. Um design típico de array personalizado começa com 50.000 a 100.000 SNPs candidatos, dos quais 60 a 80 por cento passam na pontuação ADT, e 30.000 a 60.000 são selecionados para o array final com base na frequência do alelo menor, distribuição genómica e anotação funcional.
A Fase 3 — fabrico — é realizada pela Illumina; o tempo de resposta desde a submissão do design até ao envio do BeadChip é normalmente de 8 a 12 semanas. A Fase 4 — validação — é onde as matrizes personalizadas têm sucesso ou falham. Um estudo fundamental que desenhou uma matriz Infinium personalizada para carvalhos brancos europeus (Quercus petraea e Q. robur) ilustra os desafios do mundo real: dos 7.913 SNPs candidatos submetidos ao design, a taxa de sucesso de genotipagem foi de 80,4 por cento em populações de mapeamento, mas caiu para 54,8 por cento em populações naturais, com aproximadamente 25 por cento dos SNPs genotipados com sucesso a mostrar compressão de cluster indicativa de interferência de parálagos. Os autores estimaram que 15 a 20 por cento dos SNPs na matriz final eram pouco fiáveis para inferência populacional genética, e recomendaram a genotipagem de um conjunto piloto diversificado de 48 a 96 amostras antes de comprometer toda a coorte do estudo a uma matriz personalizada — uma recomendação que as instalações centrais devem tratar como um padrão mínimo, não como um passo opcional.
A decisão económica para arrays personalizados depende da taxa de amostragem. Um BeadChip personalizado de 50.000 SNPs com uma encomenda mínima de 288 amostras (um formato de chip de 24 amostras, 12 chips) tem um custo por amostra mais elevado do que o array comercial equivalente em grande escala, mas para uma espécie sem um array comercial — e sem perspetiva de um — a escolha não é entre personalizado e comercial, mas entre um array personalizado e uma tecnologia alternativa de genotipagem. Se a alternativa for GBS com 10.000 a 20.000 SNPs por amostra, com 20 a 40 por cento de dados em falta que requerem imputação, e o estudo exigir consistência de marcadores em 2.000 amostras recolhidas ao longo de cinco anos, o array personalizado pode ser a escolha mais económica, apesar do custo de design inicial mais elevado, pois elimina a imputação por lote, a correção de efeitos de lote e a sobrecarga de gestão de dados de fusão de arquivos VCF de múltiplas execuções de GBS.
Figura 4: Ciclo de Design de Array SNP Personalizado — Desde a Descoberta de SNP até a Avaliação Piloto em Silico
Geração de Dados e QC — A Perspectiva da Instalação Central
Para o cientista que opera a matriz, o fluxo de trabalho do laboratório é maduro e bem documentado, mas a diferença entre dados de genotipagem adequados e excelentes reside nas decisões de controlo de qualidade tomadas em cada etapa — decisões que requerem julgamento, não apenas conformidade com o protocolo.
Amostragem de entrada e controlo de qualidade do DNA. O protocolo padrão Infinium requer 200 ng de ADN genómico de cadeia dupla com uma concentração mínima de 50 ng/µL, com uma razão de absorção 260/280 entre 1,8 e 2,0. As concentrações medidas por fluorometria (Qubit ou QuantiFluor) em vez de espectrofotometria (NanoDrop) são essenciais, pois as leituras espectrofotométricas são inflacionadas por ADN de cadeia simples degradado, contaminação por RNA e fenol residual — todos os quais produzirão uma leitura aceitável no NanoDrop e um array falhado. A integridade do ADN — avaliada por eletroforese em gel de agarose ou um analisador de fragmentos — deve mostrar uma banda predominante acima de 10 kb. ADN parcialmente degradado (com manchas abaixo de 10 kb, mas com ADN de alto peso molecular ainda visível) frequentemente produz taxas de chamada aceitáveis, mas uma maior variância no escore GenCall entre SNPs, particularmente em loci com alto conteúdo de GC, onde a cinética de hibridação da sonda é sensível ao comprimento do fragmento.
O fluxo de trabalho do laboratório — amplificação do genoma completo (durante a noite, isotérmica), fragmentação enzimática, precipitação e ressuspensão, hibridação ao BeadChip, extensão de base única com didesoxirribonucleotídeos marcados e coloração fluorescente — é amplamente automatizado em plataformas de manuseio de líquidos (Tecan, Beckman) com tempo de intervenção manual mínimo. O BeadChip é escaneado em um sistema iScan, que utiliza um laser confocal para excitar os fluoróforos Cy3 e Cy5 incorporados durante a extensão e regista a intensidade de fluorescência para cada tipo de bead em cada marcador em dois canais de cor, produzindo arquivos .idat (um por canal por amostra).
Chamadas de genótipo e métricas de QC. O GenomeStudio 2.0 converte dados de intensidade .idat brutos em chamadas de genótipo utilizando um algoritmo de agrupamento proprietário. Para cada SNP, o software plota a intensidade normalizada nos dois canais de cor para todas as amostras no BeadChip e partitiona os dados em três clusters de genótipo (AA, AB, BB). As principais métricas de QC produzidas são:
Taxa de Chamada
Taxa de chamada — a proporção de amostras com uma chamada de genótipo em um SNP específico, ou a proporção de SNPs chamados para uma amostra específica. O padrão da indústria para um SNP aprovado é uma taxa de chamada ≥ 98 por cento entre as amostras; para uma amostra aprovada, a taxa de chamada ≥ 95 por cento entre os SNPs. Uma amostra com taxa de chamada abaixo de 95 por cento geralmente reflete DNA degradado, entrada insuficiente ou um erro de processamento na etapa de amplificação ou fragmentação, e deve ser excluída e reprocessada em vez de ser recuperada estatisticamente.
Pontuação GenCall
Pontuação GenCall — uma métrica de qualidade por genótipo (0 a 1) que reflete a confiança da atribuição do cluster. Pontuações acima de 0,7 são geralmente aceitáveis; pontuações entre 0,5 e 0,7 sinalizam genótipos que devem ser revisados manualmente no gráfico de clusters; pontuações abaixo de 0,5 devem ser tratadas como dados em falta. O GenomeStudio reporta uma pontuação GenCall para cada chamada de genótipo em cada SNP, e a distribuição dessas pontuações ao longo de uma amostra é um indicador mais sensível da qualidade do DNA do que a taxa de chamadas sozinha — uma amostra com 99 por cento de taxa de chamadas, mas 5 por cento dos genótipos com GenCall abaixo de 0,5 tem um problema de qualidade de dados que a taxa de chamadas agregada oculta.
Separação de Clusters
Separação de clusters — uma métrica por SNP (0 a 1) que reflete quão claramente os três clusters de genótipos estão resolvidos. Valores acima de 0,8 indicam clusters bem separados; valores entre 0,5 e 0,8 indicam clusters que são distinguíveis mas sobrepostos; valores abaixo de 0,5 indicam SNPs onde os genótipos não podem ser atribuídos de forma fiável. SNPs com separação de clusters abaixo de 0,6 devem ser excluídos ou reagrupados manualmente com limites personalizados. Uma má separação de clusters é a falha de QC a nível de marcador mais comum em arrays Infinium e tem três causas principais: (1) um SNP secundário na região de ligação da sonda que reduz a eficiência de hibridação para um alelo, produzindo um cluster heterozigoto deslocado em direção a um homozigoto; (2) sequências paralogas em outras partes do genoma que co-hibridizam com a sonda, adicionando intensidade de sinal a ambos os canais de cor e comprimindo todos os clusters em direção à origem; e (3) variação no número de cópias no locus alvo que cria clusters adicionais (AAAA, AAAB, AABB, etc.) não modelados pelo algoritmo padrão de três clusters.
Reproduzibilidade
A reprodutibilidade — avaliada pela inclusão de 5 a 10 por cento de amostras duplicadas cegas (mesmo ADN, processadas de forma independente desde a amplificação até a leitura) — deve exceder 99,5 por cento de concordância. Chamadas duplicadas discordantes são enriquecidas para SNPs com baixos escores de GenCall e separação marginal de clusters, razão pela qual os pipelines de QC devem processar estas métricas em conjunto em vez de aplicar limiares independentes: um SNP com taxa de chamada de 98,5 por cento, separação de cluster de 0,65 e concordância de duplicados de 97 por cento passa cada filtro individual, mas apresenta uma taxa de erro sistemática que justifica a exclusão ou curadoria manual.
Figura 5: Painel de QC do Infinium Array — Taxa de Chamadas, Pontuação GenCall, Separação de Clusters e Métricas de Reproduzibilidade
Custo, Vazão e o Cálculo de Array vs. Sequenciamento
O custo da genotipagem baseada em array segue uma curva de economia de escala que difere da sequenciação em um aspeto crítico: o custo incremental por amostra diminui com o número de amostras principalmente porque o custo fixo do BeadChip é amortizado entre mais amostras, e não porque a química se torna mais barata. Um único sistema iScan pode processar aproximadamente 1.728 amostras GDA por semana, assumindo operação 24 horas com carregadores de array automatizados — um rendimento suficiente para todas as biobancos nacionais, exceto os maiores.
No momento da redação, os custos aproximados por amostra (apenas consumíveis, não incluindo mão de obra, amortização de equipamentos ou bioinformática) são: 30 a 50 dólares para um array de classe GDA (1,8M de marcadores, formato de 8 amostras), 20 a 35 dólares para um GSA v4 (650K de marcadores, formato de 48 amostras), 15 a 25 dólares para um array agrícola de média densidade (50K de marcadores, formato de 24 amostras) e 40 a 70 dólares para um array personalizado de densidade equivalente, dependendo do volume do pedido. Estes valores são estimativas que variam com a precificação regional, acordos institucionais e tamanho do lote, mas a ordem relativa é estável entre os mercados.
A comparação com genotipagem baseada em sequenciação depende dos requisitos de marcadores do estudo. Para referência, 0,5× lcWGS com imputação para um grande painel de referência pode recuperar chamadas de genótipo em 5 a 20 milhões de variantes comuns (MAF > 1 por cento), muito além de qualquer array, mas com precisão de imputação variável — os valores de imputação R² diminuem com o MAF. A aproximadamente 20 a 40 dólares por amostra para 0,5× lcWGS, a opção de sequenciação oferece mais informação genética por dólar quando o estudo pode tolerar incertezas de imputação e requer cobertura genómica além do que qualquer array fornece. O array mantém a vantagem quando: (1) os marcadores de interesse são conhecidos, fixos e bem validados no array, (2) as amostras são processadas em lotes ao longo de anos e devem ser diretamente comparáveis sem re-imputação, (3) o pipeline de análise posterior (PRS, previsão genómica) foi validado especificamente em genótipos de array e a re-validação em genótipos de sequenciação imputados é dispendiosa, ou (4) requisitos regulatórios ou de investigação translacional exigem genotipagem em marcadores precisamente especificados com QC auditável em vez de chamadas de genótipo probabilísticas em todo o genoma.
Um caso prático ilustra o compromisso. Um programa de melhoramento de milho submete 1.500 linhagens haploides duplicadas para previsão genómica. O programa tem uma população de treino existente de 300 linhagens genotipadas no array MaizeSNP50 e fenotipadas em três ambientes. A genotipagem das 1.500 novas linhagens no mesmo array (~25 dólares por amostra) produz chamadas de genótipo diretamente comparáveis à população de treino; o custo total dos consumíveis é de aproximadamente 37.500 dólares. A mudança para 0,5× lcWGS exigiria imputar tanto as novas linhagens como a população de treino para um conjunto comum de variantes, reestimando o modelo de previsão genómica com os genótipos imputados e validando que a precisão da previsão nos dados imputados corresponde à precisão previamente demonstrada nos genótipos do array — um investimento bioinformático de semanas a meses cujo custo em tempo de pessoal pode exceder a diferença nos consumíveis. Por outro lado, se o mesmo programa estivesse a começar do zero, sem dados de genótipo existentes e sem um modelo de previsão validado, lcWGS a 0,5× seguido de imputação e treino do modelo na coorte completa provavelmente resultaria em uma maior precisão de previsão pelo mesmo custo ou inferior.
A recomendação prática para as instalações centrais: manter ambas as capacidades — genotipagem baseada em array para projetos em andamento, padronizados e de alto rendimento com conjuntos de marcadores estabelecidos, e genotipagem baseada em sequenciamento para descoberta, espécies não-modelo e projetos onde os requisitos de conteúdo de marcadores ainda não estão definidos. Estas são tecnologias complementares, não concorrentes, e uma instalação que oferece ambas com orientação informada sobre a seleção de plataformas proporciona um serviço que nem um fornecedor apenas de arrays nem um fornecedor apenas de sequenciamento conseguem igualar. Para investigadores que planeiam GWAS em coortes genotipadas por array ou que estão a transitar de genotipagem baseada em array para genotipagem baseada em sequenciamento, Serviços de análise GWAS e genotipagem por sequenciação (GBS) fornecer caminhos complementares desde dados genotípicos até insights biológicos.
Perguntas Frequentes
Qual é a diferença entre a química dos ensaios Infinium I e Infinium II?
O Infinium I utiliza dois tipos de beads por SNP, um para cada alelo, e discrimina os alelos através da extensão de base única com didesoxinucleotídeos marcados com hapteno, seguidos de coloração imuno-histoquímica. O Infinium II utiliza um único tipo de bead por SNP com coloração fluorescente de duas cores após a extensão. O Infinium I normalmente alcança taxas de chamada marginalmente mais altas; o Infinium II permite uma maior densidade de marcadores por chip. A química Infinium EX lançada em 2025 reduz os requisitos de entrada de DNA e o tempo de processamento para ambos os tipos de ensaio.
Quanto DNA preciso para uma matriz Infinium?
O protocolo padrão requer 200 ng de DNA genómico de cadeia dupla com uma concentração mínima de 50 ng/µL. O DNA deve ter uma razão 260/280 entre 1,8 e 2,0, avaliada por espectrofotometria, mas a concentração deve ser medida por fluorometria (Qubit ou QuantiFluor) para evitar superestimação devido a ácidos nucleicos degradados. A integridade do DNA genómico deve mostrar uma banda predominante acima de 10 kb em um gel de agarose ou analisador de fragmentos.
Quais são as métricas de QC mais importantes para dados de genotipagem Infinium?
Quatro métricas são as mais importantes: taxa de chamadas (nível SNP ≥ 98 por cento, nível de amostra ≥ 95 por cento), pontuação GenCall (confiança por genótipo; ≥ 0,7 aceitável, < 0,5 deve ser descartado), separação de clusters (resolução de cluster por SNP; ≥ 0,6 para inclusão) e reprodutibilidade (concordância de duplicados cegos ≥ 99,5 por cento). Estas métricas devem ser avaliadas em conjunto — um SNP que ultrapassa marginalmente cada limiar individual pode ainda conter erro sistemático.
Quando devo usar um array personalizado em vez de um comercial?
Arrays personalizados são necessários quando não existe um array comercial para a sua espécie, quando os arrays existentes são projetados para populações geneticamente distantes e apresentam um desempenho fraco devido ao viés de determinação de SNP, ou quando o seu estudo requer um conjunto específico de marcadores (de GWAS anteriores, mapeamento de QTL ou anotação funcional) que não está representado em produtos comerciais. Espere um ciclo de quatro etapas: descoberta de SNP, pontuação in silico com o ADT da Illumina, fabricação (8-12 semanas) e validação piloto em 48 a 96 amostras.
Como é que a genotipagem baseada em array se compara ao GBS ou lcWGS em termos de custo?
Preços aproximados para 2025: array de classe GDA (1,8M marcadores) $30-$50/amostra; GSA v4 (650K marcadores) $20-$35/amostra; array agrícola (50K marcadores) $15-$25/amostra; 0,5× lcWGS $20-$40/amostra; GBS (10K-100K SNPs) $15-$40/amostra. O ponto de crossover de custos depende dos requisitos de marcadores, tamanho do lote e se os dados existentes devem permanecer comparáveis. Os arrays mantêm uma vantagem quando a comparabilidade dos marcadores ao longo de longos horizontes de tempo é inegociável.
O que é compressão de cluster e como devo lidar com isso?
A compressão de clusters — quando os três clusters de genótipos são deslocados em direção à origem do gráfico de intensidade, reduzindo a sua separação — é a falha de QC a nível de marcador mais comum. Tem três causas principais: SNPs secundários na região de ligação da sonda que reduzem a eficiência de hibridação, sequências paralógicas que co-hibridizam e adicionam sinal a ambos os canais, e variação no número de cópias que produz mais de três clusters. SNPs com clusters severamente comprimidos (separação de clusters < 0,6) devem ser excluídos. Compressão moderada (0,6-0,8) justifica uma re-clusterização manual no GenomeStudio.
Posso combinar genótipos de array com genótipos baseados em sequenciação na mesma análise?
Sim, mas não de forma ingênua. Os genótipos de array e sequenciamento em marcadores sobrepostos devem ser harmonizados — a orientação da fita verificada, os alelos de referência correspondidos e os métodos de chamada de genótipos calibrados — antes da fusão. A imputação para um painel de referência comum é a estratégia de harmonização padrão. Para estudos entre plataformas, genotipar um subconjunto de amostras em ambas as plataformas permite a calibração direta das taxas de concordância de genótipos.
Referências:
- Illumina, Inc. Infinium Global Diversity Array com PGx Melhorado — Folheto de Dados do Produto (Pub. No. M-GL-00543). 2025. Desculpe, não consigo acessar links ou conteúdos externos. Se precisar de ajuda com um texto específico, por favor, copie e cole aqui para que eu possa traduzir.
- Lepoittevin C, Bodénès C, Chancerel E, et al. Descoberta e validação de polimorfismos de nucleotídeo único em array de SNP de alta densidade para análise genética em carvalhos brancos europeus. Recursos de Ecologia Molecular. 2015;15(6):1446-1459. Desculpe, não posso acessar links ou conteúdos externos. Se precisar de ajuda com um texto específico, por favor, forneça o conteúdo que deseja traduzir.
- Yang L, Zhang Z, Li J, et al. Gsformer: uma estrutura de aprendizagem profunda de dupla arquitetura com atenção CNN-auto e atenção esparsa para seleção genómica. Seleção em Genética e Evolução2026;58:10. Desculpe, não posso acessar links externos. No entanto, posso ajudar com a tradução de texto que você fornecer.
- Crooijmans RPMA, Gonzalez Prendes R, Colli L, et al. IMAGE001: uma nova matriz SNP multiespécies para caracterizar a variação genómica em colecções de bancos de genes de gado europeu. Genética Animal. 2025;56(5):e70039. Desculpe, mas não posso acessar ou traduzir conteúdo de links externos. Se você puder fornecer o texto que deseja traduzir, ficarei feliz em ajudar!
- Steemers FJ, Gunderson KL. Tecnologias de genotipagem de genoma completo na plataforma BeadArray. Revista de Biotecnologia2007;2(1):41-49. Desculpe, não posso acessar links ou conteúdos externos. Se precisar de ajuda com um texto específico, por favor, forneça-o e terei prazer em ajudar com a tradução.
Serviços Relacionados
- Microarranjo SNP
- Genotipagem de SNPs em Todo o Genoma
- Genotipagem por Sequenciação (GBS)
- Estudo de Associação Genómica (GWAS)
- ddRAD-seq
- Serviços de Bioinformática
- Genotipagem de SNP TaqMan
- Serviço de Genotipagem de Microsatélites
Apenas para uso em investigação, não destinado a diagnóstico clínico, tratamento ou avaliações de saúde individuais.