Elton José logo
Elton José
Anthropic

950 Agentes, 21 Horas: Como A Claude Achou Um Sistema Enzimático Parecido Com CRISPR

950 Agentes, 21 Horas: Como A Claude Achou Um Sistema Enzimático Parecido Com CRISPR
0 visualizações
17 minutos de leitura
#Anthropic

950 Agentes, 21 Horas: Como A Claude Achou Um Sistema Enzimático Parecido Com CRISPR

Quando a notícia apareceu, um colega mandou o link no grupo do time com um comentário curto: "agora a IA descobre enzima". A frase veio meio em tom de piada, meio em tom de ameaça, e a conversa que seguiu foi previsível — metade achando que era marketing, metade achando que era o começo do fim da bancada de laboratório. Eu não sou biólogo e não tenho como avaliar a descoberta em si. Mas quando abri o anúncio da Anthropic, o que me prendeu não foi a biologia. Foram os números.

Cerca de 950 agentes. 21 horas. 210 milhões de tokens. Mais de 200 mil transcriptases reversas reunidas, 3.500 sistemas candidatos, 20 finalistas, e no fim um laboratório com gente de verdade testando o que sobrou. Para quem passa o dia desenhando sistema distribuído, isso não lê como anúncio científico. Lê como a descrição de um job de produção: fan-out massivo, filtragem em estágios, critério de corte, revisão humana no final do funil.

Neste post vou explicar o mínimo de biologia para o resto fazer sentido, tratar os números como se fossem a especificação de um sistema, desenhar — deixando claro que é hipótese minha — como um pipeline assim provavelmente é organizado, discutir o funil como um problema de precisão e recall, e fechar com o que ainda não dá para afirmar. Um aviso logo de saída: a Anthropic não publicou a arquitetura interna completa. Tudo que for leitura minha vai estar marcado como tal.


O Que Foi Encontrado, Em Linguagem De Dev

CRISPR, em uma frase: é um sistema de defesa de bactérias que guarda pedaços de DNA de vírus num arranjo de sequências repetidas e usa essas "memórias" para reconhecer e cortar o invasor na próxima vez — mecanismo que a ciência transformou em ferramenta de edição de genes. A parte que importa para este post é a arquitetura: uma enzima que faz o trabalho, e um arranjo de repetições regularmente espaçadas que funciona como uma espécie de tabela de lookup programável. Troque o conteúdo entre as repetições e você muda o alvo.

O que a Anthropic anunciou em 23 de setembro foi um sistema que ela batizou de ART, sigla em inglês para transcriptases reversas associadas a arranjos. Ele foi encontrado em bacteriófagos — vírus que infectam bactérias — e tem três peças: uma transcriptase reversa (enzima que copia RNA em DNA), um gene parceiro e um arranjo de repetições de DNA espaçadas de forma regular. É essa terceira peça que dá o "parecido com CRISPR": o desenho lembra muito o arranjo que torna o CRISPR programável.

Segundo o anúncio, os primeiros experimentos de laboratório mostraram que o arranjo do ART é expresso como um conjunto de RNAs curtos e distintos. Isso é consistente com a hipótese de que o sistema seja programável de alguma forma, do mesmo jeito que o CRISPR usa RNAs curtos como guia. Consistente, não comprovado. A própria Anthropic trata o resultado como achado inicial e diz que mais experimentos estão em andamento.

Um detalhe que o anúncio faz questão de registrar e que eu acho saudável: a transcriptase reversa em si não era nova. Ela já tinha sido identificada em estudos anteriores, num fago do tipo "jumbo". O que a Anthropic diz é que a Claude parece ter sido a primeira a notar as características que definem o sistema ao redor da enzima. Ou seja, a contribuição não foi achar uma peça inédita, foi reconhecer um padrão num contexto que ninguém tinha olhado com atenção.

Por que "parecido com CRISPR" importa, então? Porque CRISPR saiu de uma curiosidade de microbiologia para uma das ferramentas mais importantes da biotecnologia. Qualquer sistema com arquitetura parecida vira candidato natural a investigação. Mas — e voltarei a isso — arquitetura parecida não significa função parecida. O Dimitri Perrin, cientista da computação que escreveu sobre o caso no The Conversation, resumiu bem, conforme citado pelo Gizmodo: dá para dizer que o ART é parecido com CRISPR na arquitetura, mas não há evidência de que seja parecido na função.


Os Números Como Especificação De Sistema

Gosto de pegar números de anúncio e colocar numa tabela, porque a tabela obriga a fazer contas que o texto corrido esconde. Todos os valores abaixo vêm da Anthropic, exceto onde indicado; as divisões são minhas.

MétricaValor informadoLeitura derivada (conta minha)
Agentes~950—
Duração da busca21 horas~45 agentes "novos" por hora, se distribuídos uniformemente (não sabemos se foram)
Tokens210 milhões~221 mil tokens por agente, em média; ~10 milhões por hora
Espaço inicial~1,9 bilhão de clusters de proteínas (Gizmodo)—
Transcriptases reunidas200.000+—
Candidatos3.500~1,75% das transcriptases
Finalistas20~0,57% dos candidatos; ~0,01% do total reunido
Participação humana"limitada ao prompt inicial e ao trabalho de laboratório"—

Algumas coisas saltam. A primeira é que 221 mil tokens por agente, em média, é pouco para um agente de longa duração e muito para uma chamada única. Isso sugere — hipótese — que a maioria dos agentes não viveu as 21 horas. O perfil parece mais o de muitos workers de vida relativamente curta, cada um cuidando de uma fatia do problema, do que o de 950 agentes monolíticos trabalhando em paralelo o tempo todo. Uma média esconde muito, claro: pode haver um orquestrador que consumiu milhões e centenas de workers que consumiram poucos milhares.

A segunda é o custo, que eu hesitei em colocar. A Anthropic não disse qual modelo rodou, qual a proporção entre tokens de entrada e de saída, nem quanto foi reaproveitado de cache. Então qualquer número é um exercício, não uma estimativa. Com essa ressalva explícita: se os 210 milhões fossem todos cobrados como entrada no preço de tabela do Claude Opus 5.5 (US$4 por milhão), daria US$840; se fossem todos saída (US$20 por milhão), US$4.200. A Anthropic, claro, não paga tabela para si mesma. O exercício só mostra a ordem de grandeza: milhares de dólares em tokens, não milhões. O custo dominante do projeto, quase certamente, está no laboratório.


Como Um Pipeline Desses Provavelmente Se Organiza

Aqui preciso ser bem claro sobre o que é fato e o que é leitura. O que a Anthropic contou: os cientistas trabalharam com o Claude Science e o Claude Code, as mesmas ferramentas disponíveis para qualquer cientista, mais "um harness próprio que coordena muitas sessões Claude rodando em paralelo". A Claude produziu relatórios legíveis por humanos para cada candidato, propondo função e apresentando evidências. Os cientistas descartaram a maioria na avaliação crítica, e os sobreviventes foram para teste bioquímico e estrutural. Só isso. Não há diagrama, não há descrição de papéis de agentes, não há critério de corte publicado.

Com esse material, o desenho que me parece mais provável é uma variação do padrão orquestrador-workers com filtragem em estágios, que é um dos cinco padrões de orquestração multiagente que mais aparecem em produção. Um orquestrador divide o espaço de busca em fatias, dispara workers para cada fatia, recolhe o que eles marcam como interessante e decide o que vai para o estágio seguinte. Em pseudocódigo, algo assim:

# Hipótese de desenho — NÃO é a arquitetura publicada pela Anthropic
def pipeline(prompt_inicial, base_de_sequencias):
    fatias = particionar(base_de_sequencias, tamanho=N)

    # Estágio 1: fan-out amplo e barato
    # cada worker varre uma fatia e devolve transcriptases com contexto genômico
    rts = fan_out(fatias, worker=coletor_de_rts, instrucoes=prompt_inicial)

    # Estágio 2: triagem estrutural (padrões na vizinhança do gene)
    candidatos = [r for r in rts if tem_arranjo_de_repeticoes(r)
                                  and nao_e_sistema_conhecido(r)]

    # Estágio 3: análise profunda, cara, só para quem passou
    dossies = fan_out(candidatos, worker=analista, instrucoes=rubrica_cientifica)

    # Estágio 4: ranking e relatório legível por humano
    finalistas = ranquear(dossies, criterio="evidencia + novidade")[:20]
    return [gerar_relatorio(f) for f in finalistas]

# Estágio 5 (fora do sistema): cientistas revisam e levam à bancada

Repare no formato. Os estágios iniciais são largos e rasos: muitos workers, contexto pequeno, pergunta simples ("tem uma transcriptase aqui, e o que tem em volta dela?"). Os estágios finais são estreitos e fundos: poucos itens, muito contexto por item, literatura, comparação com sistemas conhecidos, justificativa escrita. Isso é o mesmo raciocínio de qualquer funil de busca — recall barato na frente, precisão cara atrás. A frase que a Claude escreveu num dos relatórios, publicada pela Anthropic, dá uma ideia do que o estágio profundo enxerga: algo como "o DNA ao lado da RT é espetacular: consigo ver a olho um arranjo de repetições em tandem... é um arranjo tipo CRISPR?!". Isso não é o output de um filtro regex, é o de um agente com contexto suficiente para estranhar.

Outra coisa que o desenho precisa ter, e que eu consideraria obrigatória num sistema com esse volume, é isolamento de contexto. Com 950 agentes, nenhum deles pode carregar o histórico dos outros. O que funciona em casos assim é o que discuti quando falei de deep agents e planejamento hierárquico: o orquestrador mantém o plano e o estado em memória externa (arquivos, uma tabela, um índice), e cada subagente recebe só a fatia e as instruções de que precisa. O resultado volta resumido, não com o raciocínio inteiro. Sem isso, o contexto do orquestrador explode muito antes das 21 horas.

E há o ponto que mais me interessa como engenheiro: o harness. A Anthropic não descreveu o dela, mas qualquer harness que coordena centenas de sessões por quase um dia precisa resolver os mesmos problemas chatos de sempre: retry quando um worker cai, idempotência quando um item é processado duas vezes, checkpoint para não perder horas de trabalho numa falha do orquestrador, limites de concorrência para não estourar rate limit, e rastreamento de qual worker produziu qual conclusão. Nada disso é glamoroso. Tudo isso é o que separa uma demo de um job que termina.


O Funil Como Problema De Precisão E Recall

Se eu tivesse que resumir o caso em uma ideia de engenharia, seria esta: o sistema não foi desenhado para acertar, foi desenhado para entregar uma lista curta o suficiente para que especialistas humanos pudessem avaliá-la. Vinte relatórios é uma quantidade que um time de cientistas consegue ler, discutir e priorizar. Três mil e quinhentos não é. Duzentos mil é absurdo. O funil existe para converter volume computacional em atenção humana gerenciável.

Isso muda como a gente deveria avaliar sistemas assim. A métrica relevante não é "a IA descobriu algo?", é algo mais próximo de precisão no topo da lista: dos 20 finalistas, quantos resistem à revisão humana, e desses, quantos se confirmam na bancada. A Anthropic foi honesta sobre essa parte: os cientistas eliminaram a maioria dos candidatos na avaliação crítica. Quer dizer que o topo da lista ainda tinha muito falso positivo — ou, dito de forma mais justa, muita hipótese que não passou no crivo de quem conhece a área.

Há um paralelo direto com o que escrevi sobre agentes que erram com confiança e falhas silenciosas. Um worker que descarta um candidato bom não gera erro, não gera alerta, não aparece em lugar nenhum. Ele simplesmente não passa o item adiante. Num pipeline de 950 agentes, esse tipo de falha é invisível por construção, e a única defesa razoável é amostragem: pegar uma fração aleatória do que cada estágio descartou e mandar para revisão, humana ou por outro agente com instruções diferentes.

A Anthropic menciona um mecanismo que conversa com isso, e que achei a parte mais interessante do anúncio do ponto de vista de processo. Ela diz que as hipóteses geradas pela Claude viraram objeto de estudo, e que o que os cientistas aprendem revisando os relatórios volta para as instruções dadas à Claude, para que ela aprenda a imitar o "gosto científico" do time. Em linguagem de engenharia: existe um loop de feedback em que a revisão humana calibra a rubrica dos estágios automáticos. É o mesmo movimento de um time que revisa falsos positivos de um classificador e ajusta o prompt ou os exemplos. Nada de mágico, e exatamente por isso reproduzível.


Onde O Humano Entra: Prompt Inicial, Gosto Científico E Bancada

A frase oficial é que a participação humana ficou "limitada ao prompt inicial e ao trabalho de laboratório". É uma frase boa para manchete e um pouco enganosa se lida sem cuidado. "Prompt inicial", nesse contexto, não é uma linha digitada num chat. Segundo o próprio Dario Amodei, citado pelo Gizmodo, o time de ciências da vida sugeriu uma área ampla de pesquisa, e a Claude leu a literatura e muitos dados genômicos a partir daí. Escolher que vale a pena olhar para transcriptases reversas em fagos, e não para qualquer outra coisa, é uma decisão de especialista. É a decisão que define se o sistema vai procurar num lugar onde existe algo a encontrar.

Depois vem a revisão dos relatórios, que o anúncio descreve como avaliação crítica em que a maioria dos candidatos caiu. E depois vem a bancada: expressar proteínas, fazer caracterização bioquímica e estrutural, interpretar os dados. A Anthropic afirma que todo esse trabalho foi feito por cientistas humanos — a automação de procedimentos de laboratório para biologia molecular ainda não está em uso ali. Então o humano está no começo, no meio e no fim. O que saiu da mão humana foi a parte de varrer, organizar e redigir a primeira hipótese.

Isso tem uma consequência prática que vale para qualquer time: o gargalo não sumiu, mudou de lugar. Antes, o limite era quanto do espaço de busca uma pessoa conseguia percorrer. Agora, com um sistema que percorre centenas de milhares de itens em um dia, o limite é quantas hipóteses o laboratório consegue validar. Experimento de bancada leva semanas ou meses, custa reagente, equipamento e gente especializada. Se a IA gera 20 candidatos por dia e o laboratório testa dois por mês, a vazão real do sistema é dois por mês.

E aqui entra uma camada que costuma ser esquecida: rastreabilidade. Um relatório que diz "este sistema é interessante" só é útil para o cientista se ele conseguir reconstruir de onde veio a conclusão — qual sequência, que comparação, que referência da literatura. Em software, isso tem nome. É o que discuti sobre observabilidade e tracing de agentes em produção: sem um trace que ligue a conclusão final às evidências e aos passos intermediários, a revisão humana vira ato de fé. Com 950 agentes envolvidos, esse trace provavelmente é a diferença entre um relatório auditável e um texto bonito.


O Que Ainda Não Dá Para Afirmar

O primeiro limite é o mais óbvio e o mais importante: ninguém sabe ainda o que o ART faz. A Anthropic não esconde isso. O Gizmodo registrou que Amodei reconheceu que a função precisa, a utilidade biotecnológica — se houver alguma — e o nível de relevância do sistema ainda não estão claros. Um arranjo de repetições que gera RNAs curtos é compatível com programabilidade, mas também é compatível com várias outras coisas. Até que alguém descubra para que o sistema serve na natureza, "parecido com CRISPR" é descrição de forma, não de função.

O segundo limite vem de quem estuda o assunto. O microbiologista Kevin Blake, da Washington University, disse à Al Jazeera e ao Gizmodo que não há nada indicando que isso seja um rival do CRISPR como tecnologia, ou que possa virar aplicação terapêutica ou prática. Ele também lembrou que existem inúmeras sequências parecidas com CRISPR ainda não identificadas em milhões de espécies de bactérias não estudadas. Ou seja, achar mais uma não é, por si só, extraordinário. O que o caso demonstra é menos a raridade do achado e mais a velocidade com que o espaço foi varrido.

O terceiro limite é de fonte. O anúncio vem da própria empresa que vende o modelo. Não é paper revisado por pares, não há dados abertos do pipeline, e a arquitetura do harness não foi publicada. Não estou dizendo que o resultado é falso — o Feng Zhang, do MIT e do Broad Institute, um dos pioneiros do CRISPR, chamou o achado de "genuinamente intrigante" e disse que ele merece mais investigação. Mas o endosso de um especialista a uma hipótese não é a mesma coisa que uma validação independente do método. O correto é tratar os números do pipeline como números do fornecedor, do mesmo jeito que trato benchmark publicado pelo próprio laboratório.

O quarto limite é de generalização. Um pipeline que funcionou para uma pergunta específica — transcriptases reversas com vizinhança genômica estranha — não prova que o mesmo arranjo funciona para qualquer pergunta científica. Buscas com critérios estruturais claros ("tem um arranjo de repetições ao lado da enzima?") são muito mais amigáveis a agentes do que perguntas em que nem o especialista sabe descrever o que é interessante. Quando falei sobre o Gemini 3 Deep Think e a entrada dos modelos na ciência, o ponto era parecido: raciocínio forte em problema bem formulado é uma coisa, formular o problema é outra.


Conclusão

Tirando a embalagem de manchete, o que a Anthropic descreveu é um sistema de produção reconhecível: um orquestrador com centenas de workers, filtragem em estágios que reduz o espaço em quatro ordens de grandeza, relatórios legíveis no final e um loop de feedback em que a revisão humana ajusta os critérios automáticos. Não sabemos os detalhes do harness, e o que desenhei aqui é leitura, não documentação. Mas o formato geral é familiar para quem já montou pipeline de dados ou sistema de triagem, e isso é, de certo modo, a notícia mais relevante para o nosso público: as técnicas que estão produzindo resultado em ciência são as mesmas que estamos aprendendo a usar em software.

Os limites são reais e não são nota de rodapé. O sistema encontrado ainda não tem função conhecida, especialistas de fora questionam a ideia de que ele concorra com o CRISPR como tecnologia, e o anúncio vem da empresa que vende o modelo, sem paper revisado nem dados abertos do pipeline. E o gargalo, como quase sempre, é a validação: o laboratório anda na velocidade do laboratório, não na velocidade dos tokens.

O que fica para mim é uma distribuição de papéis que acho honesta. O especialista humano define onde vale procurar, estabelece o que conta como evidência, revisa o que chega e decide o que vai para a bancada. O sistema de agentes faz a parte que antes era inviável por volume. Nenhuma das duas metades funciona sem a outra, e não tenho certeza de quanto essa fronteira vai se mover nos próximos anos. Mas, por enquanto, a pergunta mais útil para quem constrói esses sistemas continua sendo a mesma: o que exatamente chega à mesa do especialista, e quanto ele pode confiar no caminho que levou até ali.

Fontes:

Newsletter

Receba os artigos mais relevantes da semana, sem quebrar seu ritmo de leitura

Um resumo semanal com os melhores posts sobre IA, engenharia de software e tecnologia, enviado no melhor momento para continuar a conversa depois da leitura.

Foto de Elton José

Escrito por

eltonjose

Engenheiro de software e estrategista de produtos digitais, focado em IA pragmática e em transformar experiências de trabalho remoto em aprendizados aplicáveis. Compartilho frameworks e decisões reais que uso em consultorias e projetos.

  • Principais temasAnthropic, Claude
  • Formato do conteúdoGuia prático + insights de carreira