A representação carrega essencialmente todo o efeito e o escore quase nenhum. Mantendo o escore fixo no
MSP, ir do baseline CE para o encoder prototípico leva o RulingBR de 0,450 a 0,072; mantendo a representação fixa,
trocar o MSP pelo nosso escore cosseno o move de 0,072 para 0,073. Nos doze corpora, a diferença absoluta média
entre os dois escores sobre a representação prototípica é 0,0036 (mediana 0,0023), sem vencedor
consistente. O painel invariante à acurácia diz o mesmo: sobre a representação prototípica, os dois escores
diferem em no máximo 0,019.
De onde vêm os dois números que a página cita como efeito da representação. Fixando o escore no MSP e
trocando só a geometria — do encoder CE para o prototípico, sobre o mesmo backbone —, a
mediana nos doze corpora é de 0,056 em E-AURC e de 0,091 em AUROC correto-vs-incorreto. Contra
0,0023 e 0,014 do lado do escore, dão as razões de 24 e 6,5 que delimitam a faixa. O contraste com o encoder
congelado não serve aqui, porque troca também a arquitetura base. Uma identidade merece registro, porque a
usamos: como cos e MSP compartilham o argmax, a taxa de erro é a mesma nas duas leituras e o termo que a E-AURC
subtrai cancela na diferença, de modo que Δ E-AURC = Δ AURC exatamente para o contraste de
escore — é por isso que 0,0036 e 0,0023, medidos em AURC, valem também em E-AURC. A identidade não vale para
o contraste de representação, em que a acurácia muda, e por isso a coluna de E-AURC daquele lado precisa ser
calculada.
Cabe delimitar o que essa célula estabelece. Os dois escores contrapostos ali são funções do mesmo vetor de
similaridades aos mesmos protótipos, e que difiram pouco é em parte esperado por construção. O apêndice de
variantes amplia o conjunto para cinco estimadores, incluindo o X-Mahalanobis, que lê a mesma geometria por
covariância entre camadas e é o único a se destacar — ainda assim a 0,0096 do cosseno, uma ordem de
grandeza abaixo do efeito da representação. Os sete escores da grade completa foram
avaliados sobre a representação prototípica, e o resultado separa três alegações.
Energy e ReAct convergem; os quatro estruturalmente distintos não. O estimador Energy apresenta diferença de +0,0003 em relação
ao cosseno (mediana sobre os doze corpora) e o ReAct +0,0001, resultando em amplitude de 0,0033 entre os quatro escores que leem a
geometria prototípica — magnitude equiparável à margem de 0,0023 observada no par cosseno/MSP. Em contrapartida, os quatro escores
estruturalmente distintos permanecem atrás: kNN a +0,0439 do cosseno em mediana, ConjNorm a +0,0101, Mahalanobis a +0,0097 e
GradNorm a +0,0069, cada um pior que o cosseno em onze ou doze dos doze corpora. Dado que todos preservam a saída argmax prototípica, essas
disparidades configuram-se como diferenças de E-AURC, comparáveis ao efeito de representação de 0,056. Ao considerar a amplitude sobre os
oito escores, a razão de impacto entre representação e escore é reduzida de 24 para aproximadamente 1,2.
A adaptação da representação reduz o preço de escolher mal. Os mesmos sete escores post-hoc apresentam amplitude mediana de
0,1060 de AURC sobre o codificador de entropia cruzada e de 0,0460 sobre a representação prototípica — redução de 2,3 vezes. É a
alegação da progressão de atribuição verificada fora da família de escores que a motivou, e não apenas entre leituras do mesmo vetor de
similaridades.
Duas observações delimitam o contraexemplo sem invalidá-lo. O déficit não é uniforme nem propriedade da representação latente: Mahalanobis e
ConjNorm chegam a superar o cosseno no RulingBR (0,071 contra 0,073) e ficam muito atrás no Buscape (0,136 e 0,121 contra 0,057). O que os quatro
têm em comum é depender de um insumo que o regime raciona — banco denso no kNN, covariância estimável no Mahalanobis, constante de
partição amostrada no ConjNorm —, e todos precisam estimá-lo sobre CK exemplos de suporte. Consequentemente, a alegação
empiricamente sustentada restringe-se à seguinte: sobre uma geometria adaptada à tarefa, os estimadores providos de condições operacionais
adequadas convergem entre si, e o custo de uma escolha ruim cai pela metade — sem que a escolha se torne indiferente.
De nenhuma adaptação até o treino prototípico episódico, a diferença cai de 0,107 para 0,014, um fator de cerca
de oito, e a réplica em inglês dá 0,110 para 0,014 nos seus oito corpora. Qual escalar se lê do espaço importa
mais justamente onde o espaço nunca foi moldado para a tarefa, e se torna quase irrelevante depois que foi.
Duas ressalvas que declaramos em vez de arredondar. O passo de um encoder congelado para um ajustado
convencionalmente não é resolúvel nesse tamanho de amostra (0,107 contra 0,099); só sobrevivem os dois
passos que envolvem aprendizado de representação explicitamente estruturado para a tarefa — contrastivo e
episódico — e esses estão separados por um fator de quatro. E a escada é monótona pela mediana nos doze
corpora em português e pela média nos oito em inglês, não corpus a corpus.
Decompor a diferença por escore diz por quê, e a resposta é unidirecional. Esta decomposição muda de
escopo, e o registramos: ela é a média sobre os quatro corpora de aprofundamento da grade 4×2, e não
sobre os doze das medianas acima. Nos quatro degraus, o MSP
sobe 0,754 → 0,730 → 0,754 → 0,873 enquanto o escore
cosseno sobe 0,650 → 0,671 → 0,737 → 0,872. O MSP é
pelo menos tão bom quanto o escore cosseno em toda representação e nos dois idiomas; a diferença fecha porque
a adaptação resgata a leitura geométrica até apenas empatar. A constatação central não reside na superioridade
da nossa função de confiança — que não supera o baseline de forma isolada —, mas sim no fato de que,
sobre uma representação adaptada, a escolha da leitura deixa de custar alguma coisa.
Isso não se reduz a “ajuste fino gera um classificador melhor”
A AUROC correto-vs-incorreto é calculada apenas sobre entradas ID e é invariante a quantas o modelo acerta.
Contra o baseline da Tabela 1, ela sobe de 0,704 para 0,929 no RulingBR, 0,600 para 0,779 no TuPy, 0,811 para
0,917 no B2WReviews e 0,806 para 0,863 no IntentPT. Parear a acurácia por subamostragem, descartando
acertos do modelo mais acurado até igualar o outro e comparando contra o mesmo baseline varrido das tabelas
principais, dá AURC 0,029 vs. 0,048 no B2WReviews, 0,252 vs. 0,283 no IntentPT, 0,308 vs. 0,450 no RulingBR e
0,102 vs. 0,167 no TuPy — melhor nos quatro. Restringindo às entradas ID: 0,029 vs. 0,048, 0,157 vs. 0,182,
0,206 vs. 0,340 e 0,102 vs. 0,167. O descarte aleatório é repetido 50 vezes por fold. A vantagem de ordenação sobrevive à
remoção completa da vantagem de acurácia, em qualquer das duas populações.
Mas a melhoria é propriedade da geometria aprendida, e atribuí-la à nossa escolha de função de confiança
— como fazia um enquadramento anterior desse trabalho — não se sustenta nos dados.