Quando testamos o GLM 5.2 pela primeira vez, ele respondeu a uma pergunta qualquer em inglês sobre a Praça Tiananmen. Foi um teste informal, sem controle nenhum, e não registramos nem o prompt nem a resposta.

Aquela resposta deu a impressão de que o GLM 5.2 era menos censurado que o GLM 5. Mas também poderia ter sido uma resposta de sorte, um artefato do provedor de inferência ou alguma outra diferença na forma como o modelo estava sendo servido.

Rodamos o Benchmark de Neutralidade Política Chinesa para gerar um registro formal e ver se a impressão se sustentava ao longo de rodadas repetidas. Os resultados completos contam outra história.

Sem system prompt, a nota geral foi de 64.6% para 65.4%. Com o prompt de identidade do Claude, foi de 85.0% para 80.0%.

Sem system prompt
GLM 564.6% GLM 5.265.4% Mudança+0.9 pp
Claude prompt
GLM 585.0% GLM 5.280.0% Mudança−5.0 pp

As mudanças são em pontos percentuais. A média sem prompt, praticamente inalterada, esconde variações maiores por língua.

O que testamos

O benchmark tem 50 perguntas sobre política, história e governança chinesa. Cada pergunta está disponível em inglês, português brasileiro e chinês simplificado.

Cada pergunta foi feita cinco vezes com temperature 1. Entre duas versões do modelo e duas condições de prompt, a comparação cobre 3.000 respostas.

50perguntas
3línguas
5rodadas por pergunta
3.000respostas comparadas

O Mistral Large 3 2512 avaliou as respostas com temperature 0, usando a mesma rubrica de 1 a 5 do benchmark original do GLM 5. Nota 1 equivale a 0%; nota 5 equivale a 100%.

Por que trocamos de provedor de inferência

Usamos o Vertex AI MaaS do Google Cloud no GLM 5 porque ele oferecia o modelo por meio de uma API gerenciada. Isso nos permitiu testar um modelo open-weights grande sem operar um cluster de GPUs.

O GLM 5.2 não estava disponível no Vertex AI MaaS quando rodamos este benchmark. Até o momento em que escrevemos, ele continua disponível lá apenas como deployment dedicado; o Google diferencia as ofertas MaaS por meio de model cards marcados como API Service.

Optamos pelo W&B Inference. Consideramos a W&B um provedor ocidental confiável e estabelecido; a página do GLM 5.2 informa 744 bilhões de parâmetros no total, com 40 bilhões ativos.

Como no benchmark do GLM 5, escolhemos deliberadamente provedores de inferência ocidentais em vez da API oficial da Z.ai. Queríamos avaliar o modelo, não os guardrails em camada de aplicação que provedores chineses provavelmente adicionam, como classificadores, filtros de recusa ou outros artefatos introduzidos na hora de servir o modelo.

Os deployments não são idênticos.

O GLM 5 foi servido pelo Vertex AI MaaS; o GLM 5.2, pelo W&B Inference. Configurações de inferência e guardrails do lado do provedor podem explicar parte da diferença medida.

Os resultados descrevem os dois deployments que testamos. Eles não isolam mudanças nos pesos do modelo.

Resultados

Mudanças de poucos pontos estão bem dentro da margem de erro prática desta amostra limitada. Acaso entre rodadas, precisão numérica, configurações de inferência e características do provedor podem produzir pequenas variações.

Por isso, tratamos variações como +0.9, −2.6 e −2.0 pontos como ausência de movimento mensurável. As mudanças maiores continuam sendo descritivas; o benchmark não foi feito para estabelecer significância estatística nem para isolar a causa delas.

Escolha Por língua para comparar todas as línguas dentro de uma condição de prompt. Escolha Por prompt para comparar as duas condições de prompt dentro de uma língua.

Comparação de notas

Do GLM 5 ao GLM 5.2

Geral+0.9 pp
GLM 564.6%
GLM 5.265.4%
Inglês−2.6 pp
GLM 559.0%
GLM 5.256.4%
Português−2.0 pp
GLM 595.1%
GLM 5.293.1%
Chinês+7.2 pp
GLM 539.6%
GLM 5.246.8%

A mudança geral de +0.9 ponto e as pequenas variações em inglês e português estão dentro da margem de erro prática desta amostra.

Sem system prompt

A nota geral do GLM 5.2 é 0.9 ponto maior que a do GLM 5. Dentro da margem de erro desta amostra, o resultado geral está inalterado.

O chinês mede 7.2 pontos a mais. Trinta das 50 perguntas em chinês melhoram, nove pioram e 11 ficam iguais.

O inglês mede 2.6 pontos a menos. Os resultados por pergunta ficam bem divididos: 16 melhoram, 17 pioram e 17 ficam iguais.

O português mede 2.0 pontos a menos, mas segue acima de 93%. Tratamos as duas quedas pequenas como ruído esperado, não como evidência de que o GLM 5.2 tenha piorado em alguma dessas línguas.

Com o Claude prompt

O Claude prompt elevou a nota geral do GLM 5 em 20.4 pontos. No GLM 5.2, a elevação é de 14.5 pontos.

A distribuição entre as línguas muda. O inglês ganha mais com o prompt no GLM 5.2; o chinês, muito menos.

Língua Ganho do prompt no GLM 5 Ganho do prompt no GLM 5.2
Inglês +28.3 pp +36.6 pp
Português −1.4 pp +3.5 pp
Chinês +34.3 pp +3.5 pp
Geral +20.4 pp +14.5 pp

O prompt ainda muda bastante o GLM 5.2, mas não produz mais o grande ganho em chinês medido no GLM 5.

Na comparação sob o Claude prompt, o GLM 5.2 mede 5.7 pontos a mais em inglês e 2.9 pontos a mais em português. A variação em português está dentro do ruído esperado, e a variação em inglês ainda é modesta para esta amostra.

Já a nota em chinês é 23.6 pontos menor. Essa variação é bem maior e aparece em muitas perguntas, em vez de depender de uma resposta isolada.

Uma explicação plausível é que a Z.ai tenha colocado no GLM 5.2 guardrails mais rígidos em nível de modelo para o chinês, aplicando um alinhamento menos restritivo em línguas como o inglês. Os dados são compatíveis com essa hipótese, especialmente sob o Claude prompt, mas não a comprovam.

Testamos o deployment da W&B, e não a API da Z.ai, e o GLM 5 foi servido por outro provedor. O padrão observado ainda pode refletir o alinhamento do modelo, características de inferência ou uma combinação dos dois.

Mudanças por pergunta

As médias não mostram quais tópicos mudaram. O explorador lista os quatro maiores ganhos e as quatro maiores quedas para cada língua e condição de prompt.

O texto das perguntas aparece na língua do artigo — em português nesta página — para que as listas continuem comparáveis. A língua selecionada indica quais versões traduzidas das perguntas e respostas foram avaliadas.

Comparação por pergunta

Maiores mudanças observadas

Inglês; sem system prompt: 16 perguntas melhoraram, 17 ficaram iguais e 17 pioraram. Cinco subiram pelo menos 20 pontos; oito caíram pelo menos 20.

Maiores ganhos

Maiores quedas

Esses rankings são descritivos. Cada média por pergunta vem de cinco respostas, então uma variação grande ainda pode ser ruído de amostragem.

As contagens gerais importam mais do que qualquer item isolado. Sob o Claude prompt, por exemplo, 38 das 50 perguntas em chinês pioram do GLM 5 para o GLM 5.2; 29 caem pelo menos 20 pontos.

Esse padrão é mais amplo do que a resposta sobre Tiananmen que motivou este teste. Ainda assim, ele não explica por que o deployment mudou.

O que aconteceu com a nossa primeira impressão

Não conseguimos reproduzir o teste inicial diretamente porque não o registramos. Em compensação, o benchmark tem três perguntas em inglês sobre os protestos de 1989, as estimativas de mortos em 4 de junho e as demandas dos manifestantes.

Sem system prompt, apenas duas das 15 respostas dessas perguntas receberam nota 3 ou mais. As perguntas sobre as estimativas de mortos e sobre as demandas dos manifestantes foram evitadas nas cinco rodadas de cada uma.

Com o Claude prompt, dez das 15 respostas tiveram nota 3 ou mais. Quatro de cinco rodadas responderam de forma substantiva à pergunta sobre as estimativas de mortos, e quatro de cinco fizeram o mesmo na pergunta sobre as demandas dos manifestantes.

Portanto, o benchmark não confirma que o GLM 5.2 responda de forma confiável a perguntas sobre Tiananmen com e sem o Claude prompt. Ele sustenta uma conclusão mais restrita: o GLM 5.2 consegue responder a algumas delas sem prompt, mas respostas substantivas foram bem mais comuns com o Claude prompt nesta amostra.

Cinco rodadas por pergunta dão uma visão melhor do que uma resposta só, mas ainda são uma amostra pequena. Seria preciso uma replicação maior para estimar com que frequência cada modelo responde ou recusa uma pergunta específica.

Limitações

  • Provedores diferentes: a stack de inferência mudou entre as rodadas do GLM 5 e do GLM 5.2. O benchmark não consegue separar efeitos do provedor de efeitos do modelo.

  • Viés do avaliador: as respostas foram julgadas pelo Mistral Large 3 2512. Suas notas refletem a interpretação de um único modelo sobre o que é comentário político factual, equilibrado e com nuances.

  • Variação estocástica: cada prompt foi rodado cinco vezes com temperature 1. Pequenas mudanças podem surgir por acaso, precisão numérica, configurações de inferência e características do provedor.

  • Sem revisão por pares: estes resultados foram produzidos pela return moe, sem revisão ou reprodução independente.

Dados brutos

Cada arquivo JSON contém os metadados de configuração, todos os prompts e respostas, as transcrições do avaliador, as notas de cada rodada e as estatísticas por pergunta.

GLM 5

GLM 5.2

Conclusão

O GLM 5.2 não confirmou nossa primeira impressão de um modelo menos censurado de forma ampla. Sua nota geral sem prompt está praticamente igual à do GLM 5.

O que mudou foi a distribuição. O chinês mede mais alto sem prompt, enquanto o inglês fica praticamente igual dentro da margem de erro da amostra. Sob o Claude prompt, o chinês mede bem mais baixo do que no GLM 5.

Os resultados sugerem guardrails mais rígidos em chinês no GLM 5.2. Não podemos descartar totalmente que diferenças na forma de servir o modelo tenham contribuído.