Porque a maioria dos resultados de investigação publicados são falsos

Sobre a maioria dos resultados de investigação publicados serem falsos. A probabilidade de verdade depende do poder estatístico, viés, nº de estudos e proporção de relações reais. É menor em estudos pequenos, efeitos fracos, maior flexibilidade e interesses. Simulações mostram que, na maioria, as afirmações são mais falsas que verdadeiras, medindo-se sobretudo o viés.

Originalmente publicado em https://journals.plos.org/plosmedicine/article?id=10.1371/journal.pmed.0020124. Tradução nossa.

Existe uma preocupação crescente de que a maioria dos resultados de investigação atualmente publicados sejam falsos. A probabilidade de uma afirmação de investigação ser verdadeira pode depender do poder estatístico e do viés do estudo, do número de outros estudos sobre a mesma questão e, mais importante ainda, da proporção entre relações verdadeiras e inexistentes entre as relações investigadas em cada área científica. Neste contexto, é menos provável que um resultado de investigação seja verdadeiro quando os estudos realizados num determinado domínio são de menor dimensão; quando os tamanhos do efeito são menores; quando existe um maior número e uma menor pré-seleção das relações testadas; quando há maior flexibilidade nos desenhos, definições, resultados e métodos analíticos; quando existem maiores interesses financeiros e de outra natureza, bem como preconceitos; e quando há mais equipas envolvidas num domínio científico na busca da significância estatística. As simulações mostram que, para a maioria dos desenhos e contextos de estudo, é mais provável que uma afirmação de investigação seja falsa do que verdadeira. Além disso, em muitos domínios científicos atuais, as conclusões de investigação alegadas podem, muitas vezes, ser simplesmente medidas precisas do viés predominante. Neste ensaio, discuto as implicações destes problemas para a condução e interpretação da investigação.

Os resultados de investigação publicados são, por vezes, refutados por evidências subsequentes, com a consequente confusão e desilusão. A refutação e a controvérsia observam-se em toda a gama de desenhos de investigação, desde ensaios clínicos e estudos epidemiológicos tradicionais [1] [2] [3] até à investigação molecular mais moderna [4] [5]. Existe uma preocupação crescente de que, na investigação moderna, as conclusões falsas possam constituir a maioria, ou mesmo a grande maioria, das afirmações científicas publicadas [6] [7] [8]. No entanto, isto não deve ser surpreendente. É possível provar que a maioria das conclusões científicas alegadas são falsas. Aqui, irei examinar os fatores-chave que influenciam este problema e algumas suas consequências.

 

Modelagem do quadro de referência para resultados falsos positivos

 

Vários metodologistas têm salientado [9] [10] [11] que a elevada taxa de não replicação (falta de confirmação) das descobertas de investigação é uma consequência da estratégia conveniente, mas infundada, de alegar resultados de investigação conclusivos com base exclusivamente num único estudo avaliado pela significância estatística formal, normalmente para um valor p inferior a 0,05. A investigação não é representada nem resumida de forma mais adequada por valores p, mas, infelizmente, existe uma noção generalizada de que os artigos de investigação médica devem ser interpretados com base apenas nos valores p. Os resultados da investigação são aqui definidos como qualquer relação que atinja significância estatística formal, por exemplo, intervenções eficazes, preditores informativos, fatores de risco ou associações. A investigação «negativa» também é muito útil. «Negativa» é, na verdade, um termo impróprio, e a interpretação errada é generalizada. No entanto, aqui iremos centrar-nos nas relações que os investigadores afirmam existir, em vez de resultados nulos.

 

É possível provar que a maioria dos resultados de investigação alegados são falsos.

 

Como já foi demonstrado anteriormente, a probabilidade de um resultado de investigação ser efetivamente verdadeiro depende da probabilidade a priori de ser verdadeiro (antes da realização do estudo), do poder estatístico do estudo e do nível de significância estatística [10] [11]. Consideremos uma tabela 2 × 2 na qual os resultados da investigação são comparados com o padrão-ouro das relações verdadeiras num determinado domínio científico. Num campo de investigação, podem ser formuladas hipóteses tanto verdadeiras como falsas sobre a presença de relações. Seja R a razão entre o número de «relações verdadeiras» e o número de «ausência de relações» entre as testadas nesse campo. R é uma característica do campo e pode variar muito, dependendo se o campo se centra em relações altamente prováveis ou se procura apenas uma ou algumas relações verdadeiras entre milhares e milhões de hipóteses que possam ser postuladas. Consideremos também, por uma questão de simplicidade computacional, campos circunscritos em que ou existe apenas uma relação verdadeira (entre muitas que podem ser hipotetizadas) ou o poder é semelhante para encontrar qualquer uma das várias relações verdadeiras existentes. A probabilidade pré-estudo de uma relação ser verdadeira é R⁄(R + 1). A probabilidade de um estudo encontrar uma relação verdadeira reflete o poder 1 – β (um menos a taxa de erro do Tipo II). A probabilidade de afirmar a existência de uma relação quando, na verdade, nenhuma existe reflete a taxa de erro do Tipo I, α. Assumindo que c relações estão a ser investigadas no campo, os valores esperados da tabela 2 × 2 são apresentados na Tabela 1. Após ter sido anunciada uma conclusão de investigação com base na obtenção de significância estatística formal, a probabilidade pós-estudo de que essa conclusão seja verdadeira é o valor preditivo positivo, VPP. O VPP é também a probabilidade complementar daquilo a que Wacholder et al. chamaram de probabilidade de relatório falso positivo [10]. De acordo com a tabela 2 × 2, obtém-se VPP = (1 − β)R⁄(R − βR + α). Um resultado de investigação é, portanto, mais provável de ser verdadeiro do que falso se (1 − β)R > α. Uma vez que, normalmente, a grande maioria dos investigadores se baseia em α = 0,05, isto significa que um resultado de investigação é mais provável de ser verdadeiro do que falso se (1 − β)R > 0,05.

 

O que é menos reconhecido é que o enviesamento e a frequência de testes independentes repetidos por diferentes equipas de investigadores em todo o mundo podem distorcer ainda mais este quadro e levar a probabilidades ainda menores de os resultados da investigação serem de facto verdadeiros. Tentaremos modelar estes dois fatores no contexto de tabelas 2 × 2 semelhantes.

 

Viés

 

Em primeiro lugar, definamos o enviesamento como a combinação de vários fatores relacionados com o desenho, os dados, a análise e a apresentação que tendem a produzir resultados de investigação quando estes não deveriam ser produzidos. Seja u a proporção de análises examinadas que não teriam sido consideradas «resultados de investigação», mas que, mesmo assim, acabam por ser apresentadas e relatadas como tal, devido ao enviesamento. O enviesamento não deve ser confundido com a variabilidade aleatória que faz com que alguns resultados sejam falsos por acaso, mesmo que o desenho do estudo, os dados, a análise e a apresentação sejam perfeitos. O viés pode implicar manipulação na análise ou na comunicação dos resultados. A comunicação seletiva ou distorcida é uma forma típica desse viés. Podemos assumir que u não depende da existência ou não de uma relação verdadeira. Esta não é uma suposição irracional, uma vez que, normalmente, é impossível saber quais as relações que são de facto verdadeiras. Na presença de viés (Tabela 2), obtém-se c1_bb86e1ee31abd829c5a6c0226788c76d75488b55.png , e o PPV diminui com o aumento de u, a menos que 1 − β ≤ α, ou seja, 1 − β ≤ 0,05 na maioria das situações. Assim, com o aumento do viés, as probabilidades de um resultado de investigação ser verdadeiro diminuem consideravelmente. Isto é ilustrado para diferentes níveis de poder e para diferentes odds pré-estudo na Figura 1. Por outro lado, resultados de investigação verdadeiros podem, ocasionalmente, ser anulados devido a um viés inverso. Por exemplo, com erros de medição significativos, as relações perdem-se no ruído [12], ou os investigadores utilizam os dados de forma ineficiente ou não conseguem detetar relações estatisticamente significativas, ou ainda podem existir conflitos de interesses que tendem a «ocultar» resultados significativos [13]. Não existem boas evidências empíricas em grande escala sobre a frequência com que esse viés inverso pode ocorrer em diversos campos de investigação. No entanto, é provavelmente justo afirmar que o viés inverso não é tão comum. Além disso, os erros de medição e a utilização ineficiente dos dados estão provavelmente a tornar-se problemas menos frequentes, uma vez que o erro de medição diminuiu com os avanços tecnológicos na era molecular e os investigadores estão a tornar-se cada vez mais sofisticados no que diz respeito aos seus dados. Independentemente disso, o viés inverso pode ser modelado da mesma forma que o viés acima referido. Além disso, o viés inverso não deve ser confundido com a variabilidade aleatória que pode levar a que se perca uma relação verdadeira devido ao acaso.

 

 

c2_g_250px_Pmed.0020124.g001.png_utm_source_en.wikisource.org_utm_campaign_parser_utm_content_thumbnail DOI: 10.1371/journal.pmed.0020124.g001
Figura 1. PPV (probabilidade de um resultado de investigação ser verdadeiro) em função das odds pré-estudo para vários níveis de viés, u
Os painéis correspondem a um poder de 0,20, 0,50 e 0,80.

 

Resultado da investigaçãoRelação verdadeira: SimRelação verdadeira: NãoTotal
Simc3_13342acd53b29670e2229bf7e96d3c790a375f3c.pngc4_b0debd42ce8b221745fd5cb136533e170ce05f37.pngc5_9c603a1d1bf65bb276b84a91f0abbc31d8552a69.png
Nãoc6_17941f3a9306462d9ba16e7f4279c7d72513fc47.pngc7_235de3c64e8074507f1ba11d6b4edded92a1333e.pngc8_f0e356630968e64366374ffb78753f0d9f373877.png
Totalc9_0a9c4bf615369fc42e46db0fa128d33b52c4f944.pngc10_680562f495b0afab43017c952eaab2b617d0ba58.pngc11_86a67b81c2de995bd608d5b2df50cd8cd7d92455.png

 

DOI: 10.1371/journal.pmed.0020124.t002

Teste com vários termos independentes

 

Várias equipas independentes podem estar a abordar os mesmos conjuntos de questões de investigação. À medida que os esforços de investigação se globalizam, é praticamente a regra que várias equipas de investigação, muitas vezes dezenas delas, possam explorar questões iguais ou semelhantes. Infelizmente, em algumas áreas, a mentalidade predominante até agora tem sido a de se concentrar em descobertas isoladas feitas por equipas individuais e interpretar as experiências de investigação de forma isolada. Um número crescente de questões tem pelo menos um estudo que alega uma descoberta de investigação, e esta recebe atenção unilateral. A probabilidade de que pelo menos um estudo, entre vários realizados sobre a mesma questão, apresente uma descoberta de investigação estatisticamente significativa é fácil de estimar. Para n estudos independentes com potência igual, a tabela 2 × 2 é apresentada na Tabela 3: PPV = R(1 − βn)/(R + 1 − [1 − α]n − Rβn) (sem considerar o viés). Com o aumento do número de estudos independentes, o PPV tende a diminuir, a menos que 1 − β < a, ou seja, tipicamente 1 − β < 0,05. Isto é ilustrado para diferentes níveis de poder e para diferentes probabilidades pré-estudo na Figura 2. Para n estudos com poder diferente, o termo βn é substituído pelo produto dos termos βi para i = 1 a n, mas as inferências são semelhantes.

 

 

c12_g_250px_Pmed.0020124.g002.png_utm_source_en.wikisource.org_utm_campaign_parser_utm_content_thumbnail DOI: 10.1371/journal.pmed.0020124.g002
Figura 2. PPV (probabilidade de um resultado da investigação ser verdadeiro) em função das probabilidades pré-estudo para vários números de estudos realizados, n
Os painéis correspondem a potências de 0,20, 0,50 e 0,80.

 

Resultado da investigaçãoRelação verdadeira  
SimNãoTotal
SimcR(1 − βn)/(R + 1)c(1 − [1 − α]n)/(R + 1)c([1 − α]n + Rβn)/(R + 1)
NãocRβn/(R + 1)c(1 − α)^n/(R + 1)c([1 − α]n + Rβn)/(R + 1)
TotalcR/(R + 1)c/(R + 1)c
DOI: 10.1371/journal/pmed.0020124.t003   

Corolários

 

Um exemplo prático é apresentado na Caixa 1. Com base nas considerações acima, é possível deduzir vários corolários interessantes sobre a probabilidade de um resultado de investigação ser, de facto, verdadeiro.

 

Caixa 1. Um exemplo: ciência com baixas probabilidades pré-estudo

Suponhamos que uma equipa de investigadores realize um estudo de associação do genoma completo para testar se algum dos 100 000 polimorfismos genéticos está associado à suscetibilidade à esquizofrenia. Com base no que sabemos sobre o grau de hereditariedade da doença, é razoável esperar que, provavelmente, cerca de dez polimorfismos genéticos entre os testados estejam verdadeiramente associados à esquizofrenia, com razões de odds relativamente semelhantes, em torno de 1,3, para esses cerca de dez polimorfismos, e com um poder estatístico bastante semelhante para identificar qualquer um deles. Então, R = 10/100 000 = 10⁻⁴, e a probabilidade pré-estudo de qualquer polimorfismo estar associado à esquizofrenia é também R/(R + 1) = 10⁻⁴. Suponhamos também que o estudo tenha 60% de poder para detetar uma associação com uma razão de odds de 1,3 ao nível de significância α = 0,05. Nesse caso, pode estimar-se que, se for encontrada uma associação estatisticamente significativa com o valor p a ultrapassar por pouco o limiar de 0,05, a probabilidade pós-estudo de que tal seja verdade aumenta cerca de 12 vezes em comparação com a probabilidade pré-estudo, mas continua a ser apenas 12 × 10⁻⁴.

Suponhamos agora que os investigadores manipulem o seu desenho, as suas análises e a apresentação dos resultados, de modo a que mais relações ultrapassem o limiar de p = 0,05, mesmo que tal limiar não tivesse sido ultrapassado caso o desenho e a análise tivessem sido rigorosamente respeitados e os resultados tivessem sido apresentados de forma exaustiva e perfeita, estritamente de acordo com o plano de estudo original. Essa manipulação poderia ser feita, por exemplo, através da inclusão ou exclusão fortuita de determinados doentes ou controlos, análises de subgrupos post hoc, investigação de contrastes genéticos que não foram originalmente especificados, alterações nas definições da doença ou dos controlos e várias combinações de comunicação seletiva ou distorcida dos resultados. Os pacotes de «mineração de dados» disponíveis no mercado orgulham-se, de facto, da sua capacidade de produzir resultados estatisticamente significativos através da «dragagem de dados». Na presença de um viés com u = 0,10, a probabilidade pós-estudo de que um resultado da investigação seja verdadeiro é de apenas 4,4 × 10−4. Além disso, mesmo na ausência de qualquer viés, quando dez equipas de investigação independentes realizam experiências semelhantes em todo o mundo, se uma delas encontrar uma associação formalmente estatisticamente significativa, a probabilidade de o resultado da investigação ser verdadeiro é de apenas 1,5 × 10−4, quase nada superior à probabilidade que tínhamos antes de qualquer uma destas investigações extensivas ter sido realizada!

Corolário 1: Quanto menores forem os estudos realizados num domínio científico, menos provável é que os resultados da investigação sejam verdadeiros. Uma amostra de pequena dimensão implica um poder estatístico menor e, para todas as funções acima referidas, o PPV para um resultado de investigação verdadeiro diminui à medida que o poder estatístico diminui em direção a 1 − β = 0,05. Assim, mantendo-se os outros fatores constantes, os resultados da investigação são mais prováveis de serem verdadeiros em áreas científicas que realizam estudos de grande dimensão, tais como ensaios controlados aleatórios em cardiologia (vários milhares de participantes aleatorizados) [14], do que em áreas científicas com estudos de pequena dimensão, como a maioria das investigações sobre preditores moleculares (tamanhos de amostra 100 vezes menores) [15].

 

Corolário 2: Quanto menores forem os tamanhos do efeito num domínio científico, menos provável é que os resultados da investigação sejam verdadeiros. O poder estatístico também está relacionado com o tamanho do efeito. Assim, os resultados da investigação são mais prováveis de serem verdadeiros em áreas científicas com efeitos de grande magnitude, como o impacto do tabagismo no cancro ou nas doenças cardiovasculares (riscos relativos de 3 a 20), do que em áreas científicas onde os efeitos postulados são pequenos, como os fatores de risco genéticos para doenças multigenéticas (riscos relativos de 1,1 a 1,5) [7]. A epidemiologia moderna vê-se cada vez mais obrigada a incidir em tamanhos de efeito mais pequenos [16]. Consequentemente, espera-se que a proporção de resultados de investigação verdadeiros diminua. Na mesma linha de pensamento, se os tamanhos reais dos efeitos forem muito pequenos num campo científico, é provável que esse campo seja assolado por alegações de falsos positivos quase omnipresentes. Por exemplo, se a maioria dos verdadeiros determinantes genéticos ou nutricionais de doenças complexas conferisse riscos relativos inferiores a 1,05, a epidemiologia genética ou nutricional seria, em grande parte, um esforço utópico.

 

Corolário 3: Quanto maior for o número e menor for a seleção das relações testadas num domínio científico, menos provável será que os resultados da investigação sejam verdadeiros. Conforme demonstrado acima, a probabilidade pós-estudo de um resultado ser verdadeiro (PPV) depende em grande medida das odds pré-estudo (R). Assim, os resultados da investigação são mais prováveis de serem verdadeiros em desenhos confirmatórios, tais como grandes ensaios clínicos aleatórios controlados de fase III, ou meta-análises dos mesmos, do que em experiências geradoras de hipóteses. Áreas consideradas altamente informativas e criativas, dada a riqueza da informação reunida e testada, tais como microarrays e outras investigações de alto rendimento orientadas para a descoberta [4] [8] [17], deveriam apresentar um PPV extremamente baixo.

 

Corolário 4: Quanto maior for a flexibilidade nos desenhos, definições, resultados e modos analíticos num domínio científico, menor será a probabilidade de os resultados da investigação serem verdadeiros. A flexibilidade aumenta o potencial de transformar o que seriam resultados «negativos» em resultados «positivos», ou seja, enviesamento, u. Para vários desenhos de investigação, por exemplo, ensaios controlados aleatórios [18] [19] [20] ou meta-análises [21] [22], têm-se verificado esforços para padronizar a sua condução e comunicação. A adesão a padrões comuns deverá aumentar a proporção de resultados verdadeiros. O mesmo se aplica aos resultados. Os resultados verdadeiros podem ser mais comuns quando os desfechos são inequívocos e universalmente aceites (por exemplo, a morte) do que quando são concebidos desfechos multifacetados (por exemplo, escalas para desfechos da esquizofrenia) [23]. Da mesma forma, áreas que utilizam métodos analíticos padronizados e consensuais (por exemplo, gráficos de Kaplan-Meier e o teste do log-rank) [24] podem produzir uma maior proporção de resultados verdadeiros do que áreas em que os métodos analíticos ainda se encontram em fase experimental (por exemplo, métodos de inteligência artificial) e apenas os «melhores» resultados são comunicados. De qualquer forma, mesmo nos desenhos de investigação mais rigorosos, o viés parece ser um problema grave. Por exemplo, há fortes indícios de que a comunicação seletiva de resultados, com manipulação dos resultados e das análises comunicados, é um problema comum mesmo em ensaios aleatórios [25]. A simples abolição da publicação seletiva não faria com que este problema desaparecesse.

 

Corolário 5: Quanto maiores forem os interesses financeiros e de outra natureza, bem como os preconceitos, num determinado campo científico, menos provável é que os resultados da investigação sejam verdadeiros. Os conflitos de interesses e os preconceitos podem aumentar o viés. Os conflitos de interesses são muito comuns na investigação biomédica [26] e, normalmente, são relatados de forma inadequada e escassa [26] [27]. O preconceito pode não ter necessariamente origens financeiras. Os cientistas de uma determinada área podem ser preconceituosos simplesmente devido à sua crença numa teoria científica ou ao seu compromisso com as suas próprias descobertas. Muitos estudos universitários, que de outra forma pareceriam independentes, podem ser realizados com o único objetivo de proporcionar a médicos e investigadores as qualificações necessárias para uma promoção ou titularidade. Tais conflitos não financeiros também podem levar a resultados e interpretações distorcidos. Investigadores de prestígio podem suprimir, através do processo de revisão por pares, o aparecimento e a divulgação de descobertas que refutem as suas próprias conclusões, condenando assim a sua área a perpetuar um falso dogma. Evidências empíricas sobre a opinião de especialistas mostram que esta é extremamente pouco fiável [28].

 

Corolário 6: Quanto mais em voga for um campo científico (com mais equipas científicas envolvidas), menos provável é que os resultados da investigação sejam verdadeiros. Este corolário aparentemente paradoxal decorre do facto de, tal como referido acima, o PPV de resultados isolados diminuir quando muitas equipas de investigadores estão envolvidas no mesmo campo. Isto pode explicar por que razão, ocasionalmente, assistimos a grande entusiasmo seguido rapidamente por graves desilusões em campos que atraem ampla atenção. Com muitas equipas a trabalhar no mesmo campo e com a produção massiva de dados experimentais, o timing é essencial para vencer a concorrência. Assim, cada equipa pode dar prioridade à busca e divulgação dos seus resultados «positivos» mais impressionantes. Os resultados «negativos» só se tornam atraentes para divulgação se alguma outra equipa tiver encontrado uma associação «positiva» sobre a mesma questão. Nesse caso, pode ser aliciante refutar uma afirmação publicada numa revista de prestígio. O termo «fenómeno de Proteu» foi cunhado para descrever este fenómeno de alternância rápida entre afirmações de investigação extremas e refutações extremamente opostas [29]. Evidências empíricas sugerem que esta sequência de opostos extremos é muito comum na genética molecular [29]. Estas consequências consideram cada fator separadamente, mas esses fatores influenciam-se frequentemente uns aos outros. Por exemplo, os investigadores que trabalham em áreas onde os tamanhos reais dos efeitos são percebidos como pequenos podem estar mais propensos a realizar estudos de grande dimensão do que os investigadores que trabalham em áreas onde os tamanhos reais dos efeitos são percebidos como grandes. Ou o preconceito pode prevalecer num campo científico em voga, minando ainda mais o valor preditivo dos resultados da investigação. As partes interessadas altamente preconceituosas podem até criar uma barreira que frustre os esforços para obter e divulgar resultados contrários. Por outro lado, o facto de um domínio ser em voga ou de haver fortes interesses envolvidos pode, por vezes, promover estudos de maior dimensão e melhores padrões de investigação, reforçando o valor preditivo dos resultados da investigação. Ou então, testes em grande escala orientados para a descoberta podem resultar num rendimento tão elevado de relações significativas que os investigadores tenham material suficiente para relatar e investigar mais a fundo, abstendo-se assim da exploração excessiva e da manipulação de dados.

 

A maioria dos resultados de investigação é falsa para a maioria dos desenhos de investigação e para a maioria das áreas

 

No contexto descrito, é bastante difícil obter um PPV superior a 50%. A Tabela 4 apresenta os resultados de simulações que utilizam as fórmulas desenvolvidas para avaliar a influência da potência, da relação entre relações verdadeiras e não verdadeiras e do viés, para vários tipos de situações que podem ser características de desenhos de estudo e contextos específicos. Um resultado proveniente de um ensaio clínico aleatório controlado, bem conduzido e com poder estatístico adequado — partindo de uma probabilidade pré-estudo de 50% de que a intervenção seja eficaz — acaba por ser verdadeiro em cerca de 85% das vezes. Espera-se um desempenho bastante semelhante de uma meta-análise confirmatória de ensaios aleatórios de boa qualidade: o viés potencial provavelmente aumenta, mas o poder estatístico e as probabilidades pré-teste são mais elevados em comparação com um único ensaio aleatório. Por outro lado, um resultado meta-analítico proveniente de estudos inconclusivos, em que a agregação de dados é utilizada para «corrigir» o baixo poder estatístico de estudos individuais, é provavelmente falso se R ≤ 1:3. Os resultados de investigação provenientes de ensaios clínicos em fase inicial com poder estatístico insuficiente seriam verdadeiros cerca de uma em cada quatro vezes, ou mesmo com menor frequência caso exista viés. Os estudos epidemiológicos de natureza exploratória apresentam resultados ainda piores, especialmente quando com poder estatístico insuficiente, mas mesmo os estudos epidemiológicos com poder estatístico adequado podem ter apenas uma probabilidade em cinco de serem verdadeiros, se R = 1:10. Por fim, na investigação orientada para a descoberta com testes em grande escala, em que as relações testadas excedem as verdadeiras em 1 000 vezes (por exemplo, 30 000 genes testados, dos quais 30 podem ser os verdadeiros culpados) [30] [31], o VPP para cada relação alegada é extremamente baixo, mesmo com uma padronização considerável dos métodos laboratoriais e estatísticos, dos resultados e da respetiva comunicação, de forma a minimizar o viés.

Tabela 4. VPP dos resultados da investigação para várias combinações de potência (1 − β), rácio entre relações verdadeiras e não verdadeiras (R) e viés (u)

1-βRuExemplo práticoPPV
0,801:10,10RCT com poder estatístico adequado, com pouco viés e odds de 1:1 antes do estudo0,85
0,952:10,30Meta-análise confirmatória de ensaios clínicos aleatórios (RCT) de boa qualidade0,85
0,801:30,40Meta-análise de estudos de pequena dimensão e resultados inconclusivos0,41
0,201:50,20RCT de fase I/II com poder estatístico insuficiente, mas bem conduzido0,23
0,201:50,80Ensaio clínico aleatório (RCT) de fase I/II com poder estatístico insuficiente e mal conduzido0,17
0,801:100,30Estudo epidemiológico exploratório com poder estatístico adequado0,20
0,201:100,30Estudo epidemiológico exploratório com poder estatístico insuficiente0,12
0,201:1 0000,80Investigação exploratória orientada para a descoberta com testes em grande escala0,0010
0,201:1 0000,20Tal como no exemplo anterior, mas com um viés mais limitado (mais padronizado)0,0015
Os PPV (valores preditivos positivos) estimados são calculados assumindo α = 0,05 para um único estudo.
RCT, ensaio clínico aleatório controlado.
DOI: 10.1371/journal.pmed.0020124.t004
    

 

 

Os resultados de investigação apresentados podem, muitas vezes, ser simplesmente medidas precisas do viés predominante

 

Conforme demonstrado, a maioria da investigação biomédica moderna opera em áreas com uma probabilidade muito baixa, tanto antes como depois do estudo, de se chegar a resultados verdadeiros. Suponhamos que, num determinado campo de investigação, não haja absolutamente nenhum resultado verdadeiro a ser descoberto. A história da ciência ensina-nos que, no passado, o esforço científico desperdiçou frequentemente recursos em áreas onde não havia absolutamente qualquer rendimento de informação científica verdadeira, pelo menos com base no nosso entendimento atual. Nesse «campo nulo», seria de esperar, idealmente, que todas as magnitudes dos efeitos observados variassem aleatoriamente em torno do valor nulo, na ausência de viés. A medida em que os resultados observados se desviam do que seria esperado apenas pelo acaso seria simplesmente uma medida pura do viés predominante.

 

Por exemplo, suponhamos que nenhum nutriente ou padrão alimentar seja, na realidade, um determinante importante para o risco de desenvolver um tumor específico. Suponhamos também que a literatura científica tenha analisado 60 nutrientes e afirme que todos eles estão relacionados com o risco de desenvolver este tumor, com riscos relativos na ordem de 1,2 a 1,4 na comparação entre os tercis de ingestão mais elevados e mais baixos. Nesse caso, os tamanhos de efeito alegados não medem nada mais do que o viés líquido que esteve envolvido na produção dessa literatura científica. Os tamanhos de efeito alegados são, de facto, as estimativas mais precisas do viés líquido. Daí decorre mesmo que, entre os «campos nulos», os campos que alegam efeitos mais fortes (muitas vezes acompanhados de alegações de importância médica ou para a saúde pública) são simplesmente aqueles que têm apresentado os piores viéses.

 

Em áreas com um PPV muito baixo, as poucas relações verdadeiras não distorceriam muito este panorama geral. Mesmo que algumas relações fossem verdadeiras, a forma da distribuição dos efeitos observados continuaria a fornecer uma medida clara dos enviesamentos presentes na área. Este conceito inverte totalmente a forma como encaramos os resultados científicos. Tradicionalmente, os investigadores têm encarado os efeitos de grande magnitude e altamente significativos com entusiasmo, como sinais de descobertas importantes. Efeitos demasiado grandes e demasiado significativos podem, na verdade, ser mais provavelmente sinais de um grande enviesamento na maioria dos domínios da investigação moderna. Devem levar os investigadores a um pensamento crítico cuidadoso sobre o que poderá ter corrido mal com os seus dados, análises e resultados.

 

É claro que os investigadores que trabalham em qualquer área provavelmente resistirão a aceitar que toda a área em que passaram as suas carreiras seja uma «área nula». No entanto, outras linhas de evidência, ou avanços na tecnologia e na experimentação, podem conduzir, eventualmente, ao desmantelamento de um domínio científico. Obter medidas do viés líquido num determinado domínio pode também ser útil para compreender qual poderá ser a amplitude do viés presente noutros domínios onde possam estar em vigor métodos analíticos, tecnologias e conflitos semelhantes.

 

Como podemos melhorar a situação?

 

Será inevitável que a maioria dos resultados de investigação seja falsa, ou podemos melhorar a situação? Um dos principais problemas é que é impossível saber com 100% de certeza qual é a verdade em qualquer questão de investigação. A este respeito, o padrão «de ouro» puro é inatingível. No entanto, existem várias abordagens para melhorar a probabilidade pós-estudo.

 

Evidências com maior poder estatístico, por exemplo, estudos de grande dimensão ou meta-análises com baixo viés, podem ajudar, uma vez que se aproximam do desconhecido «padrão de excelência». No entanto, os estudos de grande dimensão podem ainda apresentar viéses, os quais devem ser reconhecidos e evitados. Além disso, é impossível obter evidências em grande escala para todos os milhões e biliões de questões de investigação colocadas na investigação atual. As evidências em grande escala devem ser direcionadas para questões de investigação em que a probabilidade pré-estudo já seja consideravelmente elevada, de modo que um resultado significativo da investigação conduza a uma probabilidade pós-teste que seja considerada bastante definitiva. As evidências em grande escala são também particularmente indicadas quando permitem testar conceitos importantes, em vez de questões específicas e restritas. Um resultado negativo pode, então, refutar não só uma afirmação específica proposta, mas todo um campo ou uma parte considerável do mesmo. Selecionar a realização de estudos em grande escala com base em critérios limitados, como a promoção de marketing de um medicamento específico, constitui, em grande parte, um desperdício de investigação. Além disso, deve-se ter em conta que estudos de dimensão extremamente grande podem ser mais propensos a encontrar uma diferença formalmente estatisticamente significativa para um efeito trivial que não seja, na realidade, significativamente diferente da hipótese nula [32] [33] [34].

 

Em segundo lugar, a maioria das questões de investigação é abordada por muitas equipas, e é enganador dar ênfase aos resultados estatisticamente significativos de uma única equipa. O que importa é a totalidade das evidências. Reduzir o viés através de padrões de investigação mais rigorosos e da limitação de preconceitos também pode ajudar. No entanto, isto pode exigir uma mudança na mentalidade científica que poderá ser difícil de alcançar. Em alguns desenhos de investigação, os esforços também podem ser mais bem-sucedidos com o registo prévio dos estudos, por exemplo, ensaios aleatórios [35]. O registo representaria um desafio para a investigação orientada para a geração de hipóteses. Algum tipo de registo ou trabalho em rede de coleções de dados ou de investigadores dentro de cada área poderá ser mais viável do que o registo de cada experiência orientada para a geração de hipóteses. De qualquer forma, mesmo que não se verifique um grande progresso no registo de estudos noutras áreas, os princípios de desenvolvimento e adesão a um protocolo poderiam ser mais amplamente adotados a partir dos ensaios controlados aleatórios.

 

Por fim, em vez de perseguir a significância estatística, devemos melhorar a nossa compreensão do intervalo de valores de R — as probabilidades pré-estudo — em que os esforços de investigação se inscrevem [10]. Antes de realizar uma experiência, os investigadores devem considerar quais consideram serem as probabilidades de estarem a testar uma relação verdadeira, em vez de uma falsa. Valores R elevados especulados podem, por vezes, ser então confirmados. Conforme descrito acima, sempre que eticamente aceitável, devem ser realizados estudos de grande dimensão com viés mínimo sobre resultados de investigação considerados relativamente estabelecidos, para verificar com que frequência estes são de facto confirmados. Suspeito que vários «clássicos» estabelecidos não passarão no teste [36].

 

No entanto, a maioria das novas descobertas continuará a provir de investigação geradora de hipóteses com probabilidades pré-estudo baixas ou muito baixas. Devemos, então, reconhecer que os testes de significância estatística no relatório de um único estudo fornecem apenas uma imagem parcial, sem sabermos quantos testes foram realizados fora do relatório e no campo relevante em geral. Apesar de existir uma vasta literatura estatística sobre correções para testes múltiplos [37], normalmente é impossível decifrar em que medida a «mineração de dados» por parte dos autores do relatório ou de outras equipas de investigação precedeu um resultado de investigação relatado. Mesmo que fosse viável determinar isso, tal não nos informaria sobre as probabilidades pré-estudo. Assim, é inevitável que se façam suposições aproximadas sobre quantas relações se espera que sejam verdadeiras entre as que foram investigadas nos campos de investigação e desenhos de investigação relevantes. O campo mais amplo pode fornecer algumas orientações para estimar esta probabilidade num projeto de investigação isolado. Seria igualmente útil recorrer às experiências decorrentes de enviesamentos detetados noutros campos afins. Embora estas suposições fossem consideravelmente subjetivas, continuariam a ser muito úteis para interpretar as conclusões da investigação e contextualizá-las.

 

Referências

  1. ↑ Ioannidis JP, Haidich AB, Lau J (2001) Algumas vítimas no confronto entre evidências aleatórias e observacionais? BMJ 322: 879–880.
  2. ↑ Lawlor DA, Davey Smith G, Kundu D, Bruckdorfer KR, Ebrahim S (2004) Aquelas vitaminas confusas: o que podemos aprender com as diferenças entre as evidências de estudos observacionais e de ensaios aleatórios? Lancet 363: 1724–1727.
  3. ↑ Vandenbroucke JP (2004) Quando é que os estudos observacionais são tão credíveis quanto os ensaios aleatórios? Lancet 363: 1728–1731.
  4. 1 2 Michiels S, Koscielny S, Hill C (2005) Previsão do prognóstico do cancro com microarrays: uma estratégia de validação aleatória múltipla. Lancet 365: 488–492.
  5. ↑ Ioannidis JPA, Ntzani EE, Trikalinos TA, Contopoulos-Ioannidis DG (2001) Validade de replicação dos estudos de associação genética. Nat Genet 29: 306–309.
  6. ↑ Colhoun HM, McKeigue PM, Davey Smith G (2003) Problemas na comunicação de associações genéticas com resultados complexos. Lancet 361: 865–872.
  7. 1 2 Ioannidis JP (2003) Associações genéticas: falsas ou verdadeiras? Trends Mol Med 9: 135–138.
  8. 1 2 Ioannidis JPA (2005) Microarrays e investigação molecular: descoberta de ruído? Lancet 365: 454–455.
  9. ↑ Sterne JA, Davey Smith G (2001) Analisando as evidências — O que há de errado com os testes de significância. BMJ 322: 226–231.
  10. 1 2 3 4 Wacholder S, Chanock S, Garcia-Closas M, Elghormli L, Rothman N (2004) Avaliar a probabilidade de um resultado positivo ser falso: uma abordagem para estudos de epidemiologia molecular. J Natl Cancer Inst 96: 434–442.
  11. 1 2 Risch NJ (2000) Em busca de determinantes genéticos no novo milénio. Nature 405: 847–856.
  12. ↑ Kelsey JL, Whittemore AS, Evans AS, Thompson WD (1996) Métodos em epidemiologia observacional, 2.ª ed. Nova Iorque: Oxford U Press. 432 p.
  13. ↑ Topol EJ (2004) Uma falha na saúde pública — o rofecoxib, a Merck e a FDA. N Engl J Med 351: 1707–1709.
  14. ↑ Yusuf S, Collins R, Peto R (1984) Por que precisamos de ensaios aleatórios de grande dimensão e simples? Stat Med 3: 409–422.
  15. ↑ Altman DG, Royston P (2000) O que entendemos por validação de um modelo prognóstico? Stat Med 19: 453–473.
  16. ↑ Taubes G (1995) A epidemiologia enfrenta os seus limites. Science 269: 164–169.
  17. ↑ Golub TR, Slonim DK, Tamayo P, Huard C, Gaasenbeek M, et al. (1999) Classificação molecular do cancro: descoberta e previsão de classes através da monitorização da expressão génica. Science 286: 531–537.
  18. ↑ Moher D, Schulz KF, Altman DG (2001) A declaração CONSORT: recomendações revistas para melhorar a qualidade dos relatórios de ensaios aleatórios de grupos paralelos. Lancet 357: 1191–1194.
  19. ↑ Ioannidis JP, Evans SJ, Gotzsche PC, O’Neill RT, Altman DG, et al. (2004) Melhor relato dos efeitos adversos em ensaios aleatórios: uma extensão da declaração CONSORT. Ann Intern Med 141: 781–788.
  20. ↑ Grupo de Trabalho de Peritos E9 da Conferência Internacional sobre Harmonização (1999) Orientação Tripartida Harmonizada da ICH. Princípios estatísticos para ensaios clínicos. Stat Med 18: 1905–1942.
  21. ↑ Moher D, Cook DJ, Eastwood S, Olkin I, Rennie D, et al. (1999) Melhorar a qualidade dos relatórios de meta-análises de ensaios clínicos aleatórios controlados: a declaração QUOROM. Qualidade da comunicação de meta-análises. Lancet 354: 1896–1900.
  22. ↑ Stroup DF, Berlin JA, Morton SC, Olkin I, Williamson GD, et al. (2000) Meta-análise de estudos observacionais em epidemiologia: uma proposta para a apresentação de resultados. Grupo de Meta-análise de Estudos Observacionais em Epidemiologia (MOOSE). JAMA 283: 2008–2012.
  23. ↑ Marshall M, Lockwood A, Bradley C, Adams C, Joy C, et al. (2000) Escalas de avaliação não publicadas: uma importante fonte de viés em ensaios clínicos aleatórios controlados de tratamentos para a esquizofrenia. Br J Psychiatry 176: 249–252.
  24. ↑ Altman DG, Goodman SN (1994) Transferência de tecnologia das revistas de estatística para a literatura biomédica. Tendências passadas e previsões futuras. JAMA 272: 129–132.
  25. ↑ Chan AW, Hrobjartsson A, Haahr MT, Gotzsche PC, Altman DG (2004) Evidência empírica da divulgação seletiva de resultados em ensaios aleatórios: comparação entre protocolos e artigos publicados. JAMA 291: 2457–2465.
  26. 1 2 Krimsky S, Rothenberg LS, Stott P, Kyle G (1998) Revistas científicas e os interesses financeiros dos seus autores: um estudo-piloto. Psychother Psychosom 67: 194–201.
  27. ↑ Papanikolaou GN, Baltogianni MS, Contopoulos-Ioannidis DG, Haidich AB, Giannakakis IA, et al. (2001) Relato de conflitos de interesses nas diretrizes de intervenções preventivas e terapêuticas. BMC Med Res Methodol 1: 3.
  28. ↑ Antman EM, Lau J, Kupelnick B, Mosteller F, Chalmers TC (1992) Uma comparação entre os resultados de meta-análises de ensaios clínicos aleatórios controlados e as recomendações de especialistas clínicos. Tratamentos para o enfarte do miocárdio. JAMA 268: 240–248.
  29. 1 2 Ioannidis JP, Trikalinos TA (2005) Podem surgir estimativas iniciais extremamente contraditórias em investigações publicadas: o fenómeno Proteus na investigação em genética molecular e em ensaios aleatórios. J Clin Epidemiol 58: 543–549.
  30. ↑ Ntzani EE, Ioannidis JP (2003) Capacidade preditiva dos microarrays de ADN para resultados oncológicos e correlatos: uma avaliação empírica. Lancet 362: 1439–1444.
  31. ↑ Ransohoff DF (2004) Regras de evidência para a descoberta e validação de marcadores moleculares do cancro. Nat Rev Cancer 4: 309–314.
  32. ↑ Lindley DV (1957) Um paradoxo estatístico. Biometrika 44: 187–192.
  33. ↑ Bartlett MS (1957) Um comentário sobre o paradoxo estatístico de D.V. Lindley. Biometrika 44: 533–534.
  34. ↑ Senn SJ (2001) Dois vivas aos valores de p. J Epidemiol Biostat 6: 193–204.
  35. ↑ De Angelis C, Drazen JM, Frizelle FA, Haug C, Hoey J, et al. (2004) Registo de ensaios clínicos: uma declaração do Comité Internacional de Editores de Revistas Médicas. N Engl J Med 351: 1250–1251.
  36. ↑ Ioannidis JPA (2005) Efeitos contraditórios e inicialmente mais fortes em investigação clínica altamente citada. JAMA 294: 218–228.
  37. ↑ Hsueh HM, Chen JJ, Kodell RL (2003) Comparação de métodos para estimar o número de hipóteses nulas verdadeiras em testes de multiplicidade. J Biopharm Stat 13: 675–689.

 

Referência: Ioannidis JPA (2005) Por que razão a maioria dos resultados de investigação publicados são falsos. PLoS Med 2(8): e124.

 

Direitos de autor: © 2005 John P. A. Ioannidis. Este é um artigo de acesso aberto distribuído ao abrigo dos termos da Licença Creative Commons Attribution, que permite a utilização, distribuição e reprodução sem restrições em qualquer meio, desde que a obra original seja devidamente citada.

 

Abreviatura: VPP, valor preditivo positivo

 

John P. A. Ioannidis integra o Departamento de Higiene e Epidemiologia da Faculdade de Medicina da Universidade de Ioannina, em Ioannina, Grécia, e o Instituto de Investigação Clínica e Estudos de Políticas de Saúde, do Departamento de Medicina do Tufts-New England Medical Center, da Faculdade de Medicina da Universidade de Tufts, em Boston, Massachusetts, Estados Unidos da América. E-mail: jioannid @ cc.uoi.gr

 

Conflitos de interesses: O autor declarou que não existem conflitos de interesses.

 

DOI: 10.1371/journal.pmed.0020124

c14_g_60px_Cc.logo.circle.svg.png_utm_source_en.wikisource.org_utm_campaign_parser_utm_content_thumbnailEste trabalho está licenciado ao abrigo da Licença Creative Commons Atribuição 2.5. Esta página deve fornecer todas as informações disponíveis sobre a autoria. 

 

Sobre esta edição digital

Este e-book provém da biblioteca online Wikisource. Esta biblioteca digital multilingue, criada por voluntários, tem como objetivo desenvolver uma coleção de acesso livre de publicações de todos os tipos: romances, poemas, revistas, cartas…

Distribuímos os nossos livros gratuitamente, começando por obras sem direitos de autor ou publicadas sob uma licença livre. É livre de utilizar os nossos e-books para qualquer finalidade (incluindo exploração comercial), ao abrigo dos termos da licença Creative Commons Atribuição-Partilha pela mesma Licença 4.0 Unported ou, se preferir, dos termos da GNU FDL.

O Wikisource está constantemente à procura de novos membros. Durante a transcrição e revisão deste livro, é possível que tenhamos cometido alguns erros. Pode comunicá-los nesta página.

Os seguintes utilizadores contribuíram para este livro:

  • Anon126
  • Calêndula (Asteraceae)
  • ShakespeareFan00
  • FruitJ
  • Jarekt
  • Kwj2772
  • Jynus
  • King of Hearts
  • Indolences
  • Delhovlyn
  • Santoposmoderno

Partilhar Artigo:

Mais Artigos

A Ontologia da Espacialidade nos Vídeojogos

Propõe-se uma ontologia não essencialista da espacialidade lúdica, em quatro níveis — representacional, mecânico, material e do jogador —, a partir do modelo das cibermédia, aplicável a jogos digitais e analógicos.

Pares Literários: Cumplicidades além das sombras no mundo das letras (parte I)

Muitas escritoras são só recordadas como companheiras de homens de letras, deixando os seus escritos no esquecimento ou pouco lidos e estudados. Apesar da barreira à consagração, percebe-se que muitas mulheres não foram meras parceiras, mas reuniram também funções diversificadas na área literária.

O fim da dependência do gás russo na UE: estratégias de substituição e transição energética

A invasão de 2022 expôs a dependência europeia do gás russo (45% em 2021). Poupança, novos fornecedores e gás liquefeito fizeram a quota cair para 12% em 2025, sem falhas de abastecimento. A crise acelerou a transição energética, apesar da inflação e de novas dependências.

Tradução e comentário de «SYLVAE», Diogo Pires, em Latim Renascentista em Portugal

Sobre o poema neolatino «SYLVAE» de Diogo Pires (Didacus Pyrrhus Lusitanus), elegia fúnebre a Silva, morto em Alcácer-Quibir (1578). Analisa o patriotismo do humanista judeu exilado, o lamento pela pátria em declínio e o paralelismo entre a morte do amigo e a crise dinástica portuguesa.