Aguarde, carregando...

O Tabuleiro

TESTE COM QUATRO INTELIGÊNCIAS ARTIFICIAIS SOBRE TEMA 1396 EM TRAMITAÇÃO NO STJ COMPARA RESPOSTAS E APONTA DIFERENÇAS ENTRE FERRAMENTAS

TESTE COM QUATRO INTELIGÊNCIAS ARTIFICIAIS SOBRE TEMA 1396 EM TRAMITAÇÃO NO STJ COMPARA RESPOSTAS E APONTA DIFERENÇAS ENTRE FERRAMENTAS
Por: Redação O Tabuleiro
Dia 07/10/2026 11h01

Experimento realizado por Silvio Comin e pelo advogado Vinícius Briglia utilizou o mesmo prompt para avaliar respostas de ChatGPT, Claude, Kimi K3 e Gemini

A utilização da inteligência artificial no Judiciário foi um dos assuntos discutidos por Silvio Comin durante entrevista ao programa O Tabuleiro, da Rádio Ilhéus FM, nesta quarta-feira (7). Durante a conversa, ele apresentou os resultados de um experimento realizado em parceria com o advogado Vinícius Briglia para comparar o desempenho de quatro ferramentas de inteligência artificial diante de uma mesma questão jurídica: o Tema 1396, em tramitação no Superior Tribunal de Justiça (STJ).

Comin explicou que utiliza diferentes ferramentas de inteligência artificial e decidiu realizar testes em áreas distintas para observar como cada sistema se comporta. Para o experimento jurídico, procurou Briglia, que escolheu o tema a ser analisado.

Segundo Comin, a divisão no trabalho era avaliar o comportamento das ferramentas, enquanto o especialista faria a análise do conteúdo jurídico produzido. “Eu analisaria a questão de resposta da inteligência artificial e ele, o conteúdo técnico mesmo das respostas”, explicou.

O Tema 1396 foi escolhido, segundo Comin, por ser considerado relevante e estar em discussão.

QUATRO FERRAMENTAS RECEBERAM O MESMO COMANDO

Para o experimento, foram utilizadas quatro ferramentas: ChatGPT, Claude, Kimi K3 e Gemini, na versão gratuita.

Comin afirmou que todas receberam exatamente o mesmo prompt e o mesmo tema. A intenção era observar o resultado inicial de cada uma, sem estabelecer uma nova interação para corrigir ou aprofundar as respostas.

O resultado, segundo ele, contrariou algumas de suas expectativas.

Comin contou que esperava que o Claude apresentasse o melhor desempenho técnico e de conteúdo, principalmente porque utiliza a ferramenta com frequência para produção de textos.

O resultado, entretanto, foi diferente do que imaginava.

O tempo de resposta também apresentou uma diferença significativa. O Gemini foi o mais rápido, com aproximadamente um minuto. Já o Kimi K3 levou cerca de 14 minutos para apresentar o resultado.

Comin ressaltou, porém, que a velocidade não foi o único critério utilizado na comparação.

Também foram observados o conteúdo produzido, as fontes citadas, a quantidade de bibliografia, a qualidade dos relatórios e o cumprimento das orientações apresentadas no prompt.

Segundo ele, algumas ferramentas apresentaram poucas fontes, enquanto outras trouxeram uma quantidade maior de referências. Também houve diferença no tamanho e na qualidade dos relatórios.

RESULTADOS NÃO FORAM IGUAIS

A comparação mostrou que as ferramentas não apresentaram exatamente o mesmo resultado, apesar de terem recebido o mesmo comando.

Comin citou diferenças principalmente nas fontes utilizadas, na quantidade de referências e no desenvolvimento do conteúdo.

Também houve situações em que as ferramentas não seguiram completamente a orientação apresentada no prompt, inclusive a solicitação para que respondessem assumindo a posição de um juiz.

De acordo com Comin, algumas ferramentas não se comportaram exatamente dessa maneira.

Ele também explicou que, naquele experimento específico, as diferenças observadas no conteúdo técnico não foram tão grandes em alguns aspectos.

A experiência, entretanto, fez com que ele reconsiderasse a utilização de algumas ferramentas para determinadas tarefas.

Comin contou que utilizava bastante o Claude para produção de textos por considerar que a ferramenta oferecia uma linguagem mais humana. Depois do teste jurídico, passou a utilizar mais o ChatGPT em algumas situações.

Sobre o Gemini, avaliou que a ferramenta apresenta um desempenho mais regular. “Não é maravilhoso em nada, mas também não é ruim em nada”, afirmou.

Já o resultado do Kimi K3 o decepcionou.

Comin relatou que tinha uma expectativa elevada em relação à ferramenta e chegou a acreditar que ela poderia representar o futuro da inteligência artificial. Depois do resultado do experimento, afirmou que pretendia deixar de pagar pelo serviço.

O RISCO DAS “ALUCINAÇÕES”

Um dos principais pontos discutidos durante a entrevista foi o risco de uma inteligência artificial apresentar uma informação que não corresponde à realidade.

Vila Nova questionou por que diferentes ferramentas poderiam produzir respostas distintas para o mesmo tema.

Comin explicou que a inteligência artificial precisa apresentar uma resposta e, quando não encontra a informação adequada disponível, pode acabar criando uma. “Ela precisa dar uma resposta. Se ela não tem a resposta certa, disponível, ela cria uma”, afirmou.

Ele chamou esse comportamento de “alucinação” e destacou que o problema também aparece na área jurídica.

Comin afirmou que já encontrou situações em que ferramentas apresentaram jurisprudências, livros e autores que não existem.

Segundo ele, isso também pode acontecer quando a inteligência artificial é utilizada para preparar palestras e treinamentos. “Eu cansei de pegar situações de citações, por exemplo, que me dava quando eu vou preparar uma palestra, um treinamento, eu peço citações. E quando você vai ver, não existia nada daquilo”, relatou.

Por isso, ele ressaltou que o usuário precisa revisar as informações apresentadas pela ferramenta. “Você pode montar de forma fácil. Mas depois você tem que revisar cada uma das informações que estão ali, porque você corre o risco de ter alguma informação errada”, afirmou.

A IA PODE SE ADAPTAR AO USUÁRIO

Outro assunto abordado foi a capacidade de a inteligência artificial adaptar suas respostas de acordo com a interação com o usuário.

Comin afirmou que, com o tempo, as ferramentas conseguem identificar características da pessoa que está utilizando o sistema e adaptar a forma como respondem.

Ele também falou sobre o risco de a inteligência artificial acabar oferecendo ao usuário aquilo que ele gostaria de ouvir.

Comin contou que configura suas próprias ferramentas para que elas não simplesmente concordem com suas opiniões.

Segundo ele, o comportamento das ferramentas pode fazer com que o usuário receba respostas que confirmem aquilo em que já acredita. “Se ela conhece você e entrega o que você quer, muitas vezes você dá aquilo como um fato absoluto e certeiro”, afirmou.

Para Comin, esse é um dos motivos pelos quais o usuário precisa manter uma postura crítica diante das respostas produzidas pela inteligência artificial.

EXPERIMENTO NÃO FOI UMA PESQUISA CIENTÍFICA

Comin fez questão de explicar que o trabalho realizado não foi apresentado como uma pesquisa científica.

Ele classificou a experiência como uma pesquisa de usuário, com o objetivo de observar algo mais próximo da utilização cotidiana das ferramentas.

No experimento jurídico, os quatro sistemas receberam o mesmo prompt e não houve uma segunda interação para modificar as respostas.

A ideia era justamente verificar o que cada ferramenta entregaria inicialmente diante da mesma solicitação.

Comin afirmou que pretende realizar outros testes, inclusive colocando uma inteligência artificial diante das respostas produzidas pelas demais.

A proposta é apresentar as respostas das outras ferramentas a cada sistema e seguir fazendo perguntas por cerca de dez rodadas, para observar se os modelos entram em contradição.

INTELIGÊNCIA ARTIFICIAL JÁ FAZ PARTE DA ROTINA

Durante a entrevista, Comin também falou sobre a presença da inteligência artificial na própria rotina.

Ele contou que acorda por volta das 4h e utiliza parte desse período para acompanhar conteúdos relacionados ao assunto, como podcasts, cursos e notícias.

No trabalho, afirmou que utiliza inteligência artificial diariamente. Uma das possibilidades, segundo ele, é iniciar uma solicitação e deixar a ferramenta trabalhando enquanto realiza outras atividades.

TESTE NA MEDICINA 

O experimento jurídico também abriu espaço para novos testes.

Comin informou que já realizou, em parceria com Vinícius Briglia, uma experiência na área médica com o médico Lister Cedro.

Segundo ele, esse teste teve uma metodologia diferente, com uma primeira bateria de perguntas e uma segunda rodada baseada no resultado anterior.

Durante a entrevista, Comin sugeriu a realização de um experimento semelhante na área do jornalismo.

A intenção é utilizar a mesma lógica de comparação em diferentes áreas para observar como as ferramentas se comportam diante dos mesmos questionamentos.

ARTIGO E PROJETO DE LIVRO

Os resultados do experimento jurídico também foram utilizados na produção de um artigo por Comin e Vinícius Briglia.

Depois de obter as respostas das quatro ferramentas, Comin utilizou o NotebookLM para reunir os pontos de convergência e divergência entre os resultados.

Ele explicou que não pretende continuar utilizando a ferramenta para esse tipo de comparação porque passou a considerar que isso poderia introduzir um viés, já que o NotebookLM está ligado ao Gemini.

O trabalho também deu origem a um projeto de livro. O título provisório é “A verdade tem parecer”.

Segundo Comin, a publicação deverá abordar erros cometidos por inteligências artificiais na área jurídica, interpretações equivocadas, informações inventadas e as chamadas “alucinações”.

“ELA NÃO TEM ÉTICA”

A discussão também chegou à questão ética.

Questionado por Vila Nova se a inteligência artificial possui ética, Comin respondeu: “Ela não tem ética. Ela não tem sentimento humano nenhum. Ela não é boa, ela não é má. Ela não é ruim, ela não é feia, ela não é bonita. Ela não tem sentimento. Ela é programada.”

Para ele, essa característica gera uma questão importante sobre responsabilidade quando uma ferramenta apresenta uma informação incorreta.

Durante a entrevista, Comin citou um caso envolvendo a Air Canada como exemplo dessa discussão. Segundo o relato apresentado por ele, um passageiro teria recebido de um sistema de inteligência artificial uma informação equivocada relacionada a uma tarifa para passageiros em situação de luto. A informação teria levado à compra de uma passagem e posteriormente a uma disputa com a companhia.

O caso foi usado por Comin para discutir a responsabilidade por informações fornecidas por sistemas de inteligência artificial. “De quem é a responsabilidade sobre uma resposta errada? De quem é a responsabilidade sobre uma instrução errada? Ou sobre uma jurisprudência errada? Isso é bem complicado e bem fascinante o tema, porque a gente não tem a resposta”, afirmou.

Confira a entrevista completa:

" target="_blank">

Deixe seu comentário para TESTE COM QUATRO INTELIGÊNCIAS ARTIFICIAIS SOBRE TEMA 1396 EM TRAMITAÇÃO NO STJ COMPARA RESPOSTAS E APONTA DIFERENÇAS ENTRE FERRAMENTAS

* Campos obrigatórios
Avalie Este Conteúdo: 1 2 3 4 5

Veja também:

Confira mais artigos relacionados e fique ainda mais informado!