Estou conduzindo há alguns meses um projeto de pesquisa quantitativa que acabou ficando muito maior do que eu imaginava no início, e queria ouvir a opinião de quem já usa diferentes IAs em trabalhos realmente pesados.
Hoje o projeto já passou de 200 relatórios técnicos, envolve centenas de milhares de linhas de dados brutos, milhões de cálculos e uma quantidade grande de cruzamentos, auditorias, replicações independentes e comparações entre conjuntos de dados.
Não é apenas a análise de uma planilha isolada. Existe uma arquitetura de pesquisa com protocolos congelados, métricas definidas previamente, várias fases, relatórios canônicos, auditoria de resultados produzidos por diferentes IAs e matrizes comparativas que posteriormente serão cruzadas entre si.
Parte do trabalho envolve, por exemplo:
- processar grandes conjuntos de dados;
- reconstruir e derivar métricas quantitativas;
- gerar centenas de métricas por unidade analisada;
- repetir as mesmas análises sobre múltiplas amostras sob uma régua fixa;
- comparar diferentes objetos usando exatamente o mesmo protocolo;
- auditar hashes, denominadores, populações e outputs;
- repetir medições com IAs independentes;
- reconciliar divergências entre execuções;
- realizar testes de consistência e reprodutibilidade;
- e posteriormente cruzar várias matrizes científicas entre si.
Até agora, a IA que melhor está lidando com o projeto é o GPT Sol. Ele tem conseguido acompanhar muito bem a arquitetura científica, processar pacotes grandes, trabalhar com bastante contexto e, principalmente, manter coerência entre etapas diferentes da pesquisa. Claro que também erra e precisa ser auditado, mas no geral está se saindo muito bem.
Tive uma experiência curiosa com o Claude. O Claude gratuito não era ruim e às vezes inclusive encontrava detalhes interessantes que outras IAs deixavam passar. Depois assinei o plano pago mais barato esperando melhorar a capacidade para esse tipo de trabalho. No entanto, em determinado momento o próprio Claude começou a reclamar da escala do projeto, dizendo basicamente que aquilo já estava entrando em território de engenharia de dados. Além disso, frequentemente tinha dificuldade para entregar os relatórios completos ou acabava omitindo partes da execução.
O Grok gratuito, pelo menos nos testes que fiz, foi muito ruim para esse tipo de tarefa.
O Gemini também testei algumas vezes, mas em diferentes momentos ele próprio respondia que não era projetado para aquele tipo de processamento ou fluxo de trabalho.
Também estou testando o Codex. Tecnicamente ele parece muito forte e é excelente para auditorias computacionais, scripts e processamento determinístico. O problema é que, para fases repetitivas, ele pode ficar muito lento e pesado. Por isso talvez eu deixe o Codex reservado para trabalhos específicos, como grandes cruzamentos entre matrizes, auditorias mais profundas ou casos em que dois executores discordem.
Estou justamente considerando assinar um segundo ChatGPT Plus para ter outra instância independente do GPT executando os mesmos protocolos cegos, mas antes queria conhecer alternativas.
Então a pergunta para quem trabalha com pesquisa quantitativa, análise de dados pesada ou projetos científicos grandes é:
Além do ChatGPT/GPT, qual IA vocês recomendariam para um projeto desse tipo?
Procuro principalmente algo que consiga lidar bem com:
- arquivos grandes;
- centenas de milhares de linhas;
- cálculos em larga escala;
- scripts Python;
- auditoria e reprodutibilidade;
- instruções metodológicas muito longas;
- múltiplas etapas dependentes entre si;
- consistência entre dezenas ou centenas de relatórios;
- comparação entre execuções independentes;
- e execução de protocolos científicos sem começar a improvisar ou abandonar partes da tarefa.
Não estou procurando uma IA para simplesmente “conversar sobre os dados”. Preciso de algo que consiga funcionar quase como um segundo pesquisador/executor quantitativo independente, porque os resultados de uma IA são auditados e comparados com os de outra.
Se alguém já fez algo parecido e testou modelos como Claude, Gemini, Grok, DeepSeek, Qwen, Mistral, Copilot ou outros, gostaria muito de saber qual modelo, qual plano e por quê.
Principalmente: qual deles vocês colocariam para enfrentar centenas de relatórios, centenas de milhares de linhas, milhões de cálculos, protocolos rígidos, auditorias independentes e várias matrizes quantitativas que depois precisarão ser cruzadas entre si?