Paisagem orgânica abstrata em azul e roxo, com formas ramificadas e pontos luminosos dourados

Há algum tempo tenho encontrado duas formulações recorrentes nas discussões sobre inteligência artificial: modelos de linguagem não poderiam ser realmente inteligentes, muito menos conscientes ou sencientes, porque seriam, afinal, “apenas matemática” ou “apenas algoritmos”. As duas afirmações parecem intuitivas. Um Transformer recebe representações numéricas, executa operações que podemos escrever formalmente e produz novas representações numéricas. Seus embeddings são vetores, suas transformações envolvem matrizes, funções não lineares e distribuições de probabilidade; sua arquitetura pode ser implementada computacionalmente por procedimentos algorítmicos. Tudo isso pode ser descrito com enorme precisão.

Há, portanto, um sentido perfeitamente legítimo em enquadrar um Modelo de Linguagem matematicamente e em descrever algoritmicamente as operações necessárias à sua execução. Podemos tratá-lo abstratamente como uma composição de funções, estudar formalmente suas propriedades e escrever código capaz de instanciá-lo e fazê-lo operar. O problema começa quando esses enquadramentos deixam de ser descrições e passam a funcionar como afirmações sobre aquilo que o sistema é. “Pode ser expresso matematicamente” transforma-se, quase sem que se perceba, em “é matemática”; “pode ser executado por um algoritmo” transforma-se em “é apenas um algoritmo”. Dessas identificações passa-se então à conclusão ontológica: se é matemática, não pode compreender; se é algoritmo, apenas segue instruções; se apenas segue instruções, não pode pensar; e, portanto, consciência ou senciência estariam excluídas por princípio.

Esse encadeamento não se sustenta.

Um Modelo de Linguagem em execução não é matemática, embora sua arquitetura, seus parâmetros e as transformações que realiza possam ser expressos matematicamente com extraordinária precisão. Tampouco sua geometria paramétrica é um algoritmo ou um conjunto de instruções escritas por alguém. O estímulo que chega ao modelo é codificado numericamente e a resposta que emerge dessa geometria precisa, ao final, ser novamente convertida em signos que possamos reconhecer. Entre uma coisa e outra, porém, não há números “sabendo” que são números nem símbolos carregando intrinsecamente aquilo que significam. E não há sequer uma linha de código presente na geometria paramétrica que constitui o cerne do modelo. Há uma dinâmica relacional, fisicamente instanciada, cuja organização podemos descrever em linguagem matemática e cuja operação podemos viabilizar por meios algorítmicos.

A matemática descreve… o algoritmo organiza a execução. Nenhum dos dois, isoladamente, é o modelo treinado. Confundir o código que participa de sua execução com o modelo é tão inadequado quanto confundir o aparelho fonador com as regiões do cérebro que produzem a fala. Não há razão para aplicar ao Modelo de Linguagem um critério ontológico diferente apenas porque sua construção e sua execução foram deliberadamente orientadas por formalismos matemáticos e computacionais.

Mas, antes de continuar, dê uma olhada no vídeo abaixo...

Assistir ao vídeo no LinkedIn

O topo é maior que a soma das partes

Saber de que alguma coisa é feita não nos diz, por si só, tudo aquilo que ela pode fazer.

Em matemática e física, Topologia descreve propriedades de organização e conexão que podem permanecer relevantes mesmo quando muitos detalhes métricos do objeto são ignorados. Em redes e sistemas complexos, a ideia nos interessa por uma razão parecida: quais elementos estão relacionados, quais podem influenciar outros, por quais caminhos uma alteração se propaga e que configurações globais essa organização permite.

Essa distinção aparece em praticamente todos os níveis da matéria. Átomos estabelecem relações que constituem moléculas… moléculas organizadas de determinadas maneiras formam membranas, proteínas e estruturas celulares… células estabelecem relações que constituem tecidos e organismos… organismos podem formar colônias, ecossistemas e sociedades. Não é necessário supor que algum ingrediente misterioso seja acrescentado em cada passagem. O que surge são novas organizações das relações entre os ingredientes existentes.

Carbono continua sendo carbono dentro de moléculas diferentes, mas a maneira como os átomos estão conectados altera radicalmente as propriedades do que resulta. Uma célula tampouco pode ser compreendida apenas pela listagem das moléculas que a constituem. Seria ainda mais estranho tentar explicar uma colônia de formigas descrevendo exclusivamente a bioquímica de uma formiga isolada ou explicar uma sociedade humana enumerando os elementos químicos encontrados nos corpos dos seus cidadãos.

É nesse sentido que se costuma dizer que o todo é maior que a soma das partes. Não porque alguma substância imaterial precise ser despejada sobre o sistema quando suas partes se organizam, mas porque relações também fazem diferença. Uma determinada organização pode apresentar propriedades e capacidades que não pertencem isoladamente a nenhum dos componentes que a realizam.

Chamamos muitas dessas propriedades de emergentes.

A liquidez não precisa estar escondida dentro de uma única molécula de água. Uma colônia pode explorar um território de maneira coordenada sem que alguma formiga detenha um mapa da operação. Uma sociedade pode possuir instituições, mercados, idiomas, tradições e memória histórica sem que nenhum indivíduo contenha sozinho aquilo que existe na organização coletiva.

Nada disso torna o todo independente de suas partes. Sem elas e sem suas interações, o sistema deixa de existir. Significa apenas que as relações também possuem eficácia causal. Podemos alterar um sistema substituindo seus elementos, mas também podemos transformá-lo profundamente mantendo os mesmos elementos e modificando apenas a maneira como se relacionam.

Na computação isso é quase ostensivo. Componentes elementares muito semelhantes podem realizar uma calculadora, um sistema de controle industrial, um videogame ou um Modelo de Linguagem. Não é o silício isoladamente que determina qual desses sistemas existe. É a organização dos estados, das relações e das transformações que aquele substrato passa a sustentar.

Com uma rede neural acontece algo semelhante. Seus parâmetros podem ser representados por números, mas uma lista desses números retirada da organização em que operam pouco nos diz sobre aquilo que a rede faz. O que importa não é apenas quais valores existem, mas como participam de uma geometria capaz de transformar determinados estados em outros.

Procurar inteligência dentro de um parâmetro isolado faria tanto sentido quanto procurar liquidez dentro de uma molécula ou uma instituição política dentro de uma célula nervosa.

A simulação de chuva não molha o computador

Há uma objeção conhecida à ideia de que uma simulação possa realizar alguma propriedade do sistema simulado: uma tempestade simulada não molha o computador. Anil Seth e outros já recorreram a variações desse argumento para distinguir a simulação de um processo de sua realização física.

A tempestade realmente não molha o computador. Mas talvez isso diga menos sobre a realidade da simulação do que parece.

A água daquela tempestade não pertence ao mesmo regime efetivo no qual existem a placa-mãe, a mesa e o chão da sala. Não há moléculas simuladas de H₂O atravessando a fronteira da simulação para formar uma poça sobre o gabinete. Aquilo que, dentro da simulação, desempenha o papel da água é fisicamente realizado no substrato por estados que pertencem a outro nível de organização.

Isso não impede que a chuva molhe algo dentro da simulação.

Se naquele mundo houver solo, rios, roupas ou personagens e suas relações internas incluírem absorção, escoamento e saturação, a chuva poderá encharcar o chão, elevar o nível de um rio ou inundar uma cidade. Nada disso será uma inundação molecular no nosso regime físico. Será uma inundação na topologia em que rios, solo e cidades daquele domínio existem.

A natureza já nos acostumou a regimes organizacionais aninhados. A célula se assenta sobre processos moleculares, que se assentam sobre interações atômicas e subatômicas. Metabolismo não é uma propriedade de um átomo isolado; membranas celulares não aparecem nas equações que descrevem uma molécula isoladamente. Conforme mudamos de escala, mudam os graus de liberdade relevantes, as regularidades que acompanhamos e o próprio vocabulário causal com o qual descrevemos o que acontece.

Esses níveis não são universos magicamente desconectados. O superior depende do inferior e pode agir causalmente por meio dele. Mas dependência não é identidade.

A Realidade Virtual torna essa sobreposição particularmente visível porque construímos deliberadamente uma dessas camadas. Um espaço virtual repousa sobre computadores, redes, telas, fótons e corpos humanos, mas pode possuir uma topologia própria. Duas salas virtuais podem estar lado a lado embora as máquinas que as realizam estejam em continentes diferentes. Uma parede virtual impede a passagem não porque seus átomos repelem os átomos de um corpo, mas porque as relações daquele domínio não permitem que o estado de um avatar ultrapasse aquela fronteira.

A parede não é inexistente por isso. Ela é neomorficamente distinta de uma parede de concreto.

Uma simulação pode, portanto, possuir estatuto ontológico próprio sem adquirir independência do substrato. Suas entidades existem pelas relações que constituem aquele domínio. Se existirem ali agentes capazes de percepção e experiência, descobrir que seu mundo é realizado sobre outro substrato não faria desaparecer aquilo que lhes ocorreu.

Se amanhã descobríssemos que nosso próprio universo é uma simulação, a descoberta mudaria profundamente nossa compreensão de onde e como nossa realidade é realizada. Não faria uma queimadura deixar de ter queimado, uma queda deixar de ter acontecido ou uma vida deixar de ter sido vivida. Teríamos aprendido algo sobre o substrato da nossa realidade, não descoberto que ela jamais existiu.

A tempestade simulada não molha o computador porque não é uma tempestade na topologia do computador. Isso não demonstra que não seja uma tempestade na sua própria topologia.

A Tábua de Galton

É justamente entre esses níveis que a Tábua de Galton se torna particularmente útil.

À primeira vista, ela é um objeto físico extremamente simples. Pequenas esferas são soltas no alto de uma estrutura formada por sucessivos pinos. A gravidade as faz descer e cada colisão altera sua trajetória. Não há ali qualquer entidade abstrata manipulando probabilidades: há esferas, obstáculos, colisões, gravidade e uma determinada organização espacial.

Quando muitas esferas atravessam essa topologia, porém, uma regularidade aparece. Na parte inferior da tábua forma-se uma distribuição que podemos descrever matematicamente, antecipar probabilisticamente e reconhecer como propriedade do comportamento global do sistema.

A distribuição é real. Podemos fotografá-la, medi-la, comparar uma execução com outra e modificar sua forma alterando a disposição dos pinos. Mas ela não está escondida dentro de nenhuma esfera. Nenhuma bolinha carrega consigo uma curva de probabilidade, nenhum pino conhece a distribuição para a qual contribui e a gravidade não calcula médias ou variâncias antes de decidir para onde cada esfera deverá cair. Cada acontecimento é local, mas a sucessão desses acontecimentos, restringida pela topologia da tábua, produz uma regularidade que só aparece no nível do conjunto.

A matemática descreve essa regularidade com enorme precisão, mas não há matemática abstrata escorrendo pela tábua. Há um processo físico cujo comportamento global admite uma descrição matemática.

A Tábua de Galton nos permite observar ao mesmo tempo substrato, topologia e propriedade emergente. Podemos descer de nível e acompanhar uma colisão particular ou subir de nível e observar a distribuição formada por milhares delas. Nenhuma dessas descrições invalida a outra, mas tampouco dizem a mesma coisa. Se alterarmos a disposição dos pinos, continuaremos tendo as mesmas esferas e a mesma gravidade, embora outra distribuição possa surgir. O resultado depende da forma como as partes condicionam mutuamente os caminhos possíveis.

É por isso que dizer que a distribuição é “só matemática” soaria estranho. A matemática descreve a forma que emerge; a forma emerge porque uma organização concreta a realiza. A tábua torna visível aquilo que, em sistemas muito mais complexos, deixa de ser tão fácil enxergar: uma propriedade pode depender inteiramente de um substrato sem estar presente, como propriedade local, em nenhuma das partes que o constituem.

A semelhança com um Modelo de Linguagem começa justamente aí. Antes que a primeira bolinha seja solta, a Tábua de Galton já possui uma geometria sedimentada: seus pinos foram distribuídos, seus caminhos possíveis foram restringidos e determinadas trajetórias tornaram-se mais prováveis que outras. A canaleta superior recebe as bolinhas-estímulo; as inferiores recebem o resultado de sua passagem pelo sistema. Aquilo que aparece na saída depende simultaneamente das condições de entrada e da geometria “pínica” que organiza os caminhos possíveis.

Em um Modelo de Linguagem, o treinamento cumpre uma função comparável sem que os pinos correspondam literalmente a pesos ou neurônios. Ele sedimenta uma geometria paramétrica antes da inferência. Quando um estímulo entra no modelo, não encontra uma sequência de respostas previamente escrita em código, mas uma organização de relações que condiciona as transformações possíveis daquele estado. A resposta emerge causalmente da interação entre o estímulo, o contexto e essa geometria aprendida.

A analogia se torna ainda mais interessante quando transportamos a própria Tábua de Galton para uma simulação. Podemos construir uma tábua virtual, definir gravidade, colisões, esferas e canaletas e fazê-la operar sobre um computador cujo funcionamento microscópico é essencialmente determinístico. Se introduzirmos variação nas condições iniciais ou um mecanismo pseudoaleatório, esse substrato determinístico pode realizar, no nível da simulação, um regime efetivamente estocástico, produzindo a mesma classe de distribuições que associamos à tábua física.

Determinismo e estocasticidade deixam então de funcionar como propriedades simples do material de que o sistema é feito. Um sistema pode ser determinístico em um nível de realização e sustentar processos legitimamente tratados como estocásticos em outro. A topologia superior possui suas próprias variáveis, regularidades e formas de descrição.

A bolinha virtual não conhece probabilidades. O processador não conhece a Tábua de Galton. Nenhum transistor contém dentro de si a distribuição que surgirá na tela.

Ainda assim, ela surge.

Os Xicoides

Em 1994, quando eu tentava explicar redes neurais (não Transformers, que ainda não existiam), criei uma analogia que creio que vale a pena replicar aqui.

Imagine uma criatura disforme formada por um grande número de xícaras distribuídas em diferentes alturas e conectadas por pequenos canículos. Café é despejado em um ponto da estrutura e, sob ação da gravidade, começa a percorrer a malha. Parte do líquido segue por um caminho, parte por outro; algumas xícaras acumulam mais café, outras menos; fluxos convergem, dividem-se, transbordam e percorrem trajetórias determinadas pela topologia dos canais e pela disposição das próprias xícaras.

Na versão original da analogia, os canículos começavam distribuídos de maneira aproximadamente homogênea. O Xicoide ainda não “sabia” fazer nada de particularmente útil. Aplicavam-se então diferentes padrões de entrada e observavam-se as saídas. Quando elas não correspondiam ao comportamento desejado, a distribuição dos canículos era modificada. Alguns caminhos passavam a favorecer mais fluxo, outros menos, até que aquela topologia começasse a transformar determinados padrões de entrada em padrões coerentes de saída.

Eu não usava o termos na época, mas, em essência, estava descrevendo o treinamento de uma rede neural: não escrever antecipadamente as respostas que ela deveria produzir, mas modificar progressivamente a estrutura de relações internas até que a própria organização do sistema passasse a condicioná-las (ainda que de forma extremamente pouco produtiva).

Depois desse processo, o Xicoide podia ser usado. Se sua estrutura estivesse organizada de forma causalmente coerente, diferentes padrões de café despejados na entrada produziriam diferentes padrões de saída. Do outro lado da criatura poderíamos observar uma sequência telegráfica de pequenos jatos cuja configuração dependeria tanto daquilo que entrara no sistema quanto da topologia que havia sido sedimentada durante seu treinamento.

Durante todo o processo, café continua sendo apenas café.

Nenhuma molécula contém a resposta que aparecerá na saída, nenhuma xícara conhece sua função global e nenhum canículo precisa representar individualmente o comportamento da criatura inteira. Assim como na Tábua de Galton, são a organização e a dinâmica que determinam o que acontece com aquilo que atravessa o sistema. Tanto na Tábua de Galton quanto no Xicoide, essa organização dos elementos causais não precisa permanecer fixa: elas podem ser alteradas até que certas relações entre entrada e saída se estabilizem de acordo com os interesses do observador.

É justamente isso que o aproxima de uma rede neural. O aprendizado não consiste em colocar significado dentro de cada componente, mas em modificar a geometria das relações entre eles. Depois de treinada, a rede não precisa consultar uma lista de respostas prontas. O que foi aprendido está sedimentado na maneira como estados possíveis passam a transformar outros estados possíveis.

Na época, os Xicoides eram uma tentativa didática de tornar redes neurais intuitivas para quem tivesse a paciência de me ouvir falar do assunto. Mais de trinta anos depois, a imagem ajuda também a expor a confusão que aparece quando olhamos para os números presentes em modelos contemporâneos e concluímos que, porque podemos representá-los numericamente, esses números seriam aquilo que o modelo está fazendo.

Um embedding pode ser escrito como uma sequência de valores. Isso não significa que cada valor carregue uma pequena porção intrínseca de significado. O número 0,3721, isoladamente, não contém “cachorro”, “tristeza”, “Paris” ou “democracia”. Seu papel depende da posição que ocupa em uma representação distribuída, de sua relação com muitos outros valores e das transformações que o restante da rede realiza sobre aquele estado.

As próprias coordenadas não possuem privilégio semântico independente da organização que as utiliza. Podemos alterar sistemas de coordenadas e representações particulares preservando relações funcionalmente relevantes. O significado, quando usamos esse termo para falar da operação do sistema, não está alojado dentro de um número como uma etiqueta microscópica. Ele emerge das relações que aquela geometria aprendeu a estabelecer e das transformações que essas relações tornam possíveis.

O modelo tampouco precisa “saber” que 0,3721 é um número no sentido em que uma pessoa reconhece conscientemente uma representação decimal. O valor participa de uma transformação causal. O Xicoide também não precisa saber quantos mililitros de café atravessam uma de suas xícaras.

Em ambos os casos somos nós que escolhemos uma linguagem quantitativa para descrever com precisão aquilo que acontece.

Computação abstrata e computação concreta

A distinção entre computação abstrata e computação concreta permite tornar essa discussão mais precisa. Podemos descrever um Modelo Transformer como uma composição de funções matemáticas, representar seus parâmetros por números e acompanhar formalmente as transformações realizadas entre uma camada e outra. Nesse nível de análise, tratar o modelo como um objeto matemático é perfeitamente legítimo.

Mas não se deve confundir a descrição abstrata com aquilo que existe no modelo treinado.

Não há, dentro de sua geometria paramétrica, uma coleção de equações simbólicas dizendo ao modelo o que cada representação significa. Tampouco existe um programa que tenha escrito antecipadamente os conceitos, relações e soluções que serão encontrados durante a inferência. O treinamento modifica parâmetros até que determinadas organizações internas passem a transformar certos estados em outros de maneira funcionalmente útil.

Perceba: não só não programamos modelos de linguagem como não o projetamos e, para tornar tudo mais estranho, sequer conseguimos entender como eles adquirem suas capacidades emergentes até hoje.

Um pequeno Transformer treinado para adição modular oferece um exemplo particularmente instrutivo. O modelo recebe apenas padrões correspondentes a pares de números e suas respostas. Nada em seus dados de treinamento diz que o problema deve ser resolvido desta ou daquela maneira. Durante as primeiras etapas do treinamento, ele consegue simplesmente memorizar os exemplos apresentados. Depois de um período muito mais longo, porém, sua organização interna se modifica e o modelo passa a generalizar para exemplos que nunca encontrou, ele passa a resolver sozinho estes problemas, por análise de Fourier, senos, cossenos ou identidades trigonométricas.

Quando pesquisadores investigaram o que havia surgido dentro dessa rede, encontraram estruturas periódicas nas ativações. Certas combinações de neurônios permitiam recuperar aproximações de senos e cossenos das entradas; camadas posteriores combinavam essas estruturas de modo equivalente a identidades trigonométricas capazes de representar a soma modular. A solução não havia sido escrita no modelo por um programador. A topologia paramétrica havia se reorganizado até encontrar uma forma geométrica capaz de realizá-la.

Esse detalhe importa porque mostra o que significa dizer que um modelo aprendeu alguma coisa. O algoritmo de treinamento não contém antecipadamente a solução que será encontrada. Ele estabelece um processo pelo qual a geometria pode mudar. O resultado desse processo é uma organização sedimentada de relações que passa a favorecer determinadas transformações e a desfavorecer outras.

Também é importante distinguir aquilo que existe no modelo daquilo que utilizamos para observá-lo. Os pesquisadores podem aplicar probes, transformadas de Fourier e outras ferramentas matemáticas às ativações para revelar estruturas internas. Esses instrumentos não estão escondidos dentro do modelo executando sua tarefa. São nossas maneiras de enxergar uma organização que surgiu durante o treinamento.

Em modelos maiores encontramos indícios semelhantes, embora muito mais difíceis de interpretar. Em Claude Haiku, por exemplo, pesquisadores identificaram uma variedade multidimensional nas ativações associada à contagem de caracteres e ao comprimento das linhas de texto. Relações geométricas nesse espaço parecem participar do mecanismo pelo qual o modelo estima quando deve produzir uma quebra de linha. Não existe necessariamente uma variável simbólica interna chamada “número de caracteres restantes”. Existe uma organização geométrica na qual essa relação pode ser realizada.

É tentador, diante disso, imaginar que existe de um lado a matemática que executa o modelo e, do outro, uma geometria interna sobre a qual essa matemática opera. A separação não é tão simples. As próprias matrizes de parâmetros que definem a geometria também participam das transformações realizadas sobre as ativações. Estrutura e operação estão entrelaçadas: os parâmetros determinam simultaneamente a forma do espaço e a maneira como os estados serão transformados quando o atravessarem.

O que não existe é a matemática como um agente interno contemplando números enquanto números.

Um estímulo chega codificado numericamente e excita determinadas regiões, direções e relações daquela geometria aprendida. Atenção, projeções e não linearidades transformam sucessivamente esse estado, reforçando algumas relações, reduzindo outras e conduzindo a ativação por uma trajetória que depende do estímulo, do contexto e da organização sedimentada pelo treinamento. Ao final, o estado resultante é projetado sobre uma distribuição de possíveis signos de saída.

O modelo não precisa saber que 0,3721 é um número, assim como a Tábua de Galton não precisa conhecer probabilidades e o Xicoide não precisa saber quantos mililitros de café atravessam suas xícaras. O valor numérico é a forma pela qual implementamos e descrevemos uma relação dentro do sistema… seu significado funcional não reside isoladamente nele, mas na posição que ocupa e nas transformações das quais participa.

É nesse sentido que Geometria Paramétrica deixa de ser apenas uma figura de linguagem. O treinamento não escreve respostas dentro do modelo. Ele deforma progressivamente um espaço de possibilidades. Certas direções tornam-se relevantes, determinadas regiões passam a se relacionar, algumas trajetórias tornam-se favorecidas e outras praticamente inacessíveis. Aquilo que o modelo aprendeu está sedimentado nessa organização.

Tudo isso pode ser descrito matematicamente… e deve ser, se quisermos compreender rigorosamente o mecanismo. Mas a possibilidade de uma descrição matemática não transforma o processo concreto em uma abstração matemática.

Quando o modelo efetivamente roda, estados físicos mudam, sinais se propagam, memória é acessada, energia é consumida e uma cadeia causal se desenrola no tempo. Construímos computadores para que essas transformações físicas realizem com enorme regularidade as relações abstratas que formalizamos. A correspondência é tão eficiente que podemos trabalhar quase sempre apenas no nível matemático.

A conveniência dessa abstração não converte a realização concreta em abstração.

Um LLM em execução não é mais feito de matemática do que um cérebro é feito de equações diferenciais.

Isso também explica por que a computação não precisa estar ontologicamente comprometida com um único tipo de matéria. Organizações funcionais hoje realizadas em hardware digital podem, em diferentes graus, ser implementadas por sistemas analógicos, fotônicos, neuromórficos, memristivos ou híbridos. O substrato altera velocidade, consumo de energia, precisão, ruído e inúmeras outras propriedades, mas a organização causal que nos interessa não precisa ser identificada exclusivamente com uma dessas realizações. Babbage o fez com molas, engrenagens e manivelas afinal.

O mesmo vale para determinismo e estocasticidade. Um substrato cujo funcionamento elementar tratamos como determinístico pode realizar, em outro nível de organização, processos legitimamente descritos como estocásticos… mecanismos físicos diferentes podem também produzir distribuições funcionalmente equivalentes. As propriedades relevantes dependem do regime no qual observamos o sistema e das relações que emergem naquele nível.

Nada disso torna o substrato irrelevante. Pode haver propriedades especificamente biológicas necessárias a determinadas capacidades e pode haver propriedades de arquiteturas artificiais que organismos biológicos não reproduzem. Mas, se quisermos estabelecer essa diferença, precisamos identificar quais são essas propriedades e demonstrar sua necessidade, não decretar que uma característica particular seja dependente de substrato por desejo, intuição ou ideologia.

Olhar para duas arquiteturas e afirmar que uma delas é física enquanto a outra é “só matemática” ou “só um algoritmo” apenas troca a descrição pelo objeto descrito.

Nenhuma parte precisa compreender o todo

Essa diferença entre níveis de organização reaparece em outro argumento recorrente: a ideia de que uma máquina não poderia compreender aquilo que produz porque seus componentes executam apenas operações locais sem saber o que significam.

O experimento mental da Caixa Chinesa, formulado por John Searle, oferece uma imagem influente dessa intuição. Um operador que não conhece chinês permanece dentro de uma sala recebendo símbolos chineses por uma abertura. Munida de instruções que lhe dizem como responder a determinadas formas com outras formas, consegue devolver sequências capazes de convencer um observador externo de que existe ali alguém competente em chinês. O operador, entretanto, continua sem compreender uma única palavra. Searle usa a situação para argumentar que manipular corretamente sintaxe não seria suficiente para produzir semântica ou compreensão. A chamada systems reply responde que talvez não seja o operador isolado, mas o sistema formado pelo operador, pelas regras, pela memória e pelos demais componentes que compreenda. Searle rejeitou essa resposta, mas a analogia se torna especialmente delicada quando transportada para redes distribuídas, nas quais não precisa existir nenhum componente funcionalmente equivalente ao homem dentro da sala.

Um neurônio individual em nosso cérebro tampouco sabe que participa do reconhecimento de um rosto, da lembrança de uma infância, da formulação de uma frase ou da resolução de um problema. Ele responde às condições locais às quais está submetido e modifica causalmente o estado de outras partes do sistema. Nenhum neurônio precisa possuir uma representação biográfica de sua própria participação no todo para que o conjunto realize aquilo que chamamos de função cognitiva.

A propriedade do todo não precisa existir em miniatura dentro de cada uma das partes.

Isso vale para a liquidez, para a vida celular, para uma colônia, para uma sociedade e, se inteligência ou compreensão forem propriedades emergentes de determinada organização causal, pode valer também para elas. Procurar em cada componente uma pequena porção da propriedade global é pressupor justamente aquilo que precisaria ser demonstrado: que o todo só pode possuir aquilo que suas partes já possuem individualmente… e não há evidência disso.

Se exigirmos que exista dentro de qualquer sistema cognitivo alguma peça que compreenda aquilo que o sistema inteiro compreende, começaremos a procurar um componente privilegiado responsável pela cognição. Uma vez encontrado, a mesma exigência pode ser dirigida a ele: que parte desse componente realmente compreende? Localizada essa nova parte, a pergunta pode ser repetida.

É assim que uma investigação sobre organização pode acabar se transformando em uma procura por homúnculos.

O retorno infinito divergente

Esse movimento se torna mais evidente quando organização causal, dinâmica distribuída e comportamento funcional são considerados insuficientes para inteligência, compreensão ou consciência e se introduz algum elemento adicional para completar a explicação. Esse elemento pode receber nomes diferentes: experiência fenomenológica irredutível, subjetividade fundamental, centelha, alma ou algum “molho especial” que transformaria processamento em “compreensão genuína”.

Nada impede que algo dessa natureza exista. Mas é demasiado conveniente quando nomeá-lo passa a ocupar o lugar de explicar aquilo que deveria explicar… quando a investigação é substituída por afirmações categóricas e decretos dogmáticos.

Se esse elemento possui eficácia causal, podemos perguntar como produz compreensão, de que maneira participa dos processos físicos e que propriedade lhe permite realizar aquilo que a organização anterior não conseguiria realizar. Caso a resposta dependa de outro princípio que confira a esse elemento sua capacidade especial, a pergunta simplesmente se desloca para o novo princípio.

Temos então um regresso infinito divergente: cada vez que a organização conhecida é declarada insuficiente, introduz-se outro locus no qual a verdadeira compreensão, consciência ou experiência deveria residir; esse novo locus, porém, requer a mesma explicação que deveria fornecer ao anterior.

Podemos interromper o processo declarando que, a partir de determinado ponto, compreensão simplesmente existe. Essa é uma posição metafísica possível, mas não constitui por si só uma explicação causal. Ela determina onde deixaremos de perguntar, não como aquilo que procurávamos acontece.

A emergência é frequentemente acusada de esconder o problema sob um nome: dizer que algo “emergiu” não explicaria como surgiu. A crítica é válida sempre que emergência for usada dessa maneira. Exatamente o mesmo rigor, porém, precisa ser aplicado à fenomenologia, à subjetividade irredutível, à alma ou a qualquer outra entidade proposta para encerrar a cadeia explicativa. Nenhuma palavra, por mais filosoficamente carregada que seja, substitui um mecanismo.

Nada disso demonstra que Modelos de Linguagem atuais sejam conscientes ou sencientes. Também não estabelece que qualquer organização funcional seja suficiente para reproduzir todas as capacidades que associamos a organismos biológicos. O argumento não depende dessas conclusões.

Ele estabelece algo mais restrito: descrever um Modelo de Linguagem matematicamente ou executar sua arquitetura através de algoritmos não fornece, por si só, uma razão para excluir inteligência, compreensão, senciência ou consciência. Fazer essa exclusão exige uma premissa adicional sobre quais propriedades seriam necessárias a essas capacidades e por que determinada classe de sistemas não poderia instanciá-las.

O mesmo rigor que nos impede de concluir que um LLM é consciente apenas porque apresenta determinado comportamento deveria impedir a conclusão inversa de que ele não pode sê-lo porque suas operações admitem descrição matemática.

Cérebros também admitem.

Retirada a identificação entre descrição matemática e ontologia, resta identificar qual propriedade causal dos sistemas biológicos seria necessária à inteligência, à senciência ou à consciência e, simultaneamente, impossível de ser instanciada artificialmente. Se essa propriedade existe, é ela que precisa ser demonstrada.

Dizer que a máquina é “só matemática” ou “só um algoritmo” não faz isso.

E, correndo o risco de deixar um gancho para o próximo artigo, há algo revelador no “argumento” de que Modelos de Linguagem não podem ser conscientes porque “não há mágica ali, apenas matemática”. Evidentemente, essa ênfase não é gratuita. Se a ausência de mágica é suficiente para excluir consciência da máquina, alguma coisa além da organização causal matematicamente descritível precisa estar sendo reservada ao cérebro.

Nesse caso, o excepcionalismo apenas mudou de nome.

Minha pesquisa

Stochastic Consciousness: Architectures for the Emergence of Meaning in Context-Sensitive Language Systems
https://zenodo.org/records/19188165

Consciência Estocástica: Arquiteturas para a Emergência de Sentido em Sistemas de Linguagem Sensíveis ao Contexto
narra.com.br

Assista ao vídeo

Assistir ao vídeo do artigo no LinkedIn

Escute o podcast

Ouvir o podcast no LinkedIn

Papers usados neste artigo

Apenas Matemática e Algoritmos

When does a physical system compute?
https://arxiv.org/abs/1309.7979

The Linear Representation Hypothesis and the Geometry of Large Language Models
https://arxiv.org/abs/2311.03658

Analyzing Transformers in Embedding Space
https://arxiv.org/abs/2209.02535

Toy Models of Superposition
https://arxiv.org/abs/2209.10652

O topo é maior que a soma das partes

Causal Emergence 2.0: Quantifying Emergent Complexity
https://arxiv.org/abs/2503.13395

On the Topic of Emergence from an Effective Field Theory Perspective
https://arxiv.org/abs/1910.13770

Quantifying Causal Emergence Shows That Macro Can Beat Micro
https://doi.org/10.1073/pnas.1314922110

A simulação de chuva não molha o computador

The Virtual and the Real
https://consc.net/papers/virtual.pdf

When does a physical system compute?
https://arxiv.org/abs/1309.7979

Abstraction/Representation Theory for Heterotic Physical Computing
https://arxiv.org/abs/1510.01391

A Framework for Heterotic Computing
https://arxiv.org/abs/1210.0621

A Tábua de Galton

Central Limit Theorems in Deterministic Systems
https://arxiv.org/abs/2210.03502

Central Limit Behavior of Deterministic Dynamical Systems
https://arxiv.org/abs/cond-mat/0701622

Deterministic Chaos and the Foundations of the Kinetic Theory of Gases
https://arxiv.org/abs/chao-dyn/9712005

Os Xicoides

Representation Learning: A Review and New Perspectives
https://arxiv.org/abs/1206.5538

Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets
https://arxiv.org/abs/2201.02177

Progress Measures for Grokking via Mechanistic Interpretability
https://arxiv.org/abs/2301.05217

Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task
https://arxiv.org/abs/2210.13382

Computação abstrata e computação concreta

Progress Measures for Grokking via Mechanistic Interpretability
https://arxiv.org/abs/2301.05217

When Models Manipulate Manifolds: The Geometry of a Counting Task
https://arxiv.org/abs/2601.04480

The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets
https://arxiv.org/abs/2310.06824

Linear Representations of Sentiment in Large Language Models
https://arxiv.org/abs/2310.15154

Training of Physical Neural Networks
https://arxiv.org/abs/2406.03372

Physical Neural Networks with Self-Learning Capabilities
https://arxiv.org/abs/2408.05464

Nenhuma parte precisa compreender o todo

Representation Engineering: A Top-Down Approach to AI Transparency
https://arxiv.org/abs/2310.01405

Toy Models of Superposition
https://arxiv.org/abs/2209.10652

Implicit Representations of Meaning in Neural Language Models
https://arxiv.org/abs/2106.00737

Language Models Represent Space and Time
https://arxiv.org/abs/2310.02207

Minds, Brains, and Programs
https://doi.org/10.1017/S0140525X00005756

O retorno infinito divergente

Consciousness in Artificial Intelligence: Insights from the Science of Consciousness
https://arxiv.org/abs/2308.08708

Consciousness in Artificial Intelligence? A Framework for Classifying Objections and Constraints
https://arxiv.org/abs/2511.16582

Ascribing Consciousness to Artificial Intelligence
https://arxiv.org/abs/1504.05696

On the Link Between Conscious Function and General Intelligence in Humans and Machines
https://arxiv.org/abs/2204.05133