Artigo longo

Classificação Seletiva em Texto Few-Shot: O Efeito da Representação sobre as Heurísticas de Confiança

12 / 12corpora em que a geometria prototípica supera todos os baselines post-hoc a 5-shot
−67%redução mediana de AURC contra o baseline mais forte sob varredura oracular
24×quanto a representação move o desempenho a mais que um escore que lê a mesma geometria, em E-AURC (mediana de 0,056 contra 0,0023); sobre os oito escores avaliados, 1,2×
0,91cobertura certificada a 5% de risco em decisões judiciais, sob calibração independente da seleção do modelo, onde o baseline ajustado é inviável
15,2%risco de fato realizado por esse limiar certificado a 5% quando classes não vistas entram no fluxo
Visão geral

Origem do ganho de desempenho

Esse é um estudo de medição e atribuição, não uma proposta de novos componentes de modelo. Classificadores few-shot apresentam desempenho subótimo na abstenção, e a área respondeu projetando escores de confiança cada vez melhores sobre uma representação tomada como dada. Avaliamos dois escores sobre quatro representações — e, depois, oito escores sobre a representação prototípica — e o efeito é carregado quase inteiramente pela representação.

Resumo

Modelos de classificação de texto em regime few-shot ordenam mal os próprios erros: sob extrema escassez de dados, as estimativas de confiança não separam predições corretas de incorretas o bastante para sustentar cobertura útil sob restrição de risco. Avaliamos doze corpora em português com orçamentos de 1 a 10 exemplos por classe, contra sete baselines post-hoc — o mais forte deles sob busca oracular de hiperparâmetros. O ajuste fino prototípico episódico desloca essa fronteira: a AURC cai em uma mediana de 67% no cenário 5-shot. Sob um conjunto de calibração disjunto também da seleção do modelo, o método certifica 0,91 de cobertura para um risco-alvo de 5% em textos de decisões judiciais, cenário em que o baseline ajustado não admite qualquer limiar viável.

Um experimento fatorial 4×2 separa representação e estimador de confiança, e localiza o efeito na representação. Medido em grandezas que descontam a acurácia, trocar a representação move o desempenho de 6 a 24 vezes mais do que trocar o escore, conforme a grandeza: mediana de 0,056 contra 0,0023 em E-AURC e de 0,091 contra 0,014 em AUROC correto-vs-incorreto, nos doze corpora. Essa faixa é medida contra os estimadores que leem a geometria prototípica: avaliados ali os sete escores post-hoc da grade, quatro deles — privados pelo regime do insumo de que precisam — ficam atrás e estreitam a razão a cerca de 1,2. Duas ressalvas qualificam o achado. As intervenções na representação não são intercambiáveis — o SetFit, mesmo na configuração escolhida por varredura própria sobre a AURC de validação, fica bem atrás e sofre degradação severa a um exemplo por classe. E o certificado limita o risco apenas in-distribution: em um fluxo contendo classes não vistas, o mesmo limiar chega a produzir erro empírico de 15,2% frente ao risco-alvo de 5%, no pior dos cinco corpora avaliados.

CONTRIBUIÇÃO 01

A avaliação mais ampla de classificação seletiva few-shot em português

Doze corpora, cinco famílias de tarefa, três orçamentos, cinco sorteios cada. A 5-shot, a geometria prototípica atinge AURC menor que todos os baselines post-hoc em todos os corpora, com corte mediano de 67% contra o mais forte deles sob busca oracular de hiperparâmetros.

CONTRIBUIÇÃO 02

Atribuição quantitativa: representação vs. escore

Uma grade 4×2 mostrando que o escore contribui com menos de 1% do efeito da representação — e que essa dominância é propriedade do regime few-shot, não de algum componente que introduzimos, já que a ablação descarta tanto o adaptador de rótulos quanto o amostrador QDA.

CONTRIBUIÇÃO 03

Cobertura certificada nos doze corpora

Com o tamanho m do conjunto de calibração reportado por corpus, e com o risco realizado quando classes não vistas entram no fluxo — o triplo da meta, e o número do qual uma decisão de implantação realmente depende.

CONTRIBUIÇÃO 04

Réplica translíngue e dois controles

A atribuição se replica em oito corpora em inglês, com os extremos da escada a menos de 0,003. Um segundo backbone (XLM-R) preserva a vantagem em nove dos doze corpora, mas não sua magnitude, e três regras de controle de risco são comparadas sobre a nossa própria representação.

ESCOPO

O que adotamos, em vez de propor

O SGR é um arcabouço post-hoc existente (Geifman & El-Yaniv, 2017) e o LAQDA um backbone existente cujos dois mecanismos consideramos dispensáveis. O ingrediente operante é um encoder prototípico simples, disponível a qualquer pessoa que já use redes prototípicas. Chamamos de ProtoSel o sistema avaliado aqui — ajuste fino prototípico episódico, escore geométrico e limiar SGR em conjunto — para distingui-lo do LAQDA, que é apenas a arquitetura base herdada.

TRABALHO ANTERIOR

A ordenação é conhecida em visão; a magnitude não

Que a qualidade da representação domine o estimador post-hoc já está estabelecido para classificadores ImageNet com dados abundantes. Nossa contribuição é a magnitude no regime few-shot. Medida em grandezas que descontam a acurácia, ela fica entre 6 e 24 vezes, conforme a grandeza: mediana de 0,056 contra 0,0023 em E-AURC e de 0,091 contra 0,014 em AUROC correto-vs-incorreto. A sensibilidade ao escore cai cerca de oito vezes com a adaptação.

Por que importa

Um estudo de atribuição estrutural, não apenas um novo escore

Testamos sete escores modernos e nenhum deles é o fator determinante; o mecanismo que efetivamente mitiga o risco seletivo sob supervisão few-shot é a geometria prototípica episódica — e isolamos as variáveis para mostrar isso.

01

Redireciona uma linha de pesquisa que concentra esforços substanciais

Detecção de OOD post-hoc e classificação seletiva avançaram sobretudo projetando funções de confiança cada vez mais elaboradas — Mahalanobis, kNN, GradNorm, ReAct, ConjNorm — sobre uma representação tomada como dada. Nossa atribuição 4×2 mostra que, no regime few-shot, esse eixo está quase esgotado. Medido em grandezas que descontam a acurácia — a comparação honesta, já que trocar o escore mantém a acurácia fixa por construção e trocar a representação não — a representação move o desempenho de 6 a 24 vezes mais que o escore, conforme a grandeza: mediana de 0,056 contra 0,0023 em E-AURC e de 0,091 contra 0,014 em AUROC correto-vs-incorreto, nos doze corpora. Em AURC bruta a razão passa de 100, mas parte dela é aritmética. A sensibilidade ao escore é ela própria função da adaptação, caindo cerca de oito vezes de um encoder congelado para um treinado episodicamente. O achado contraria nosso próprio enquadramento anterior, e é isso que o torna digno de relato: é necessário redirecionar o foco empírico dos escores post-hoc para a estruturação do espaço latente.

02

Decide se um sistema com controle de risco é implantável

Ninguém havia mostrado se uma regra livre de distribuição como o SGR conseguiria tirar a cobertura do zero quando a própria representação é estimada a partir de cinco exemplos por classe. Sob calibração disjunta, o baseline ajustado não admite limiar viável algum a 5% de risco em seis dos doze corpora; nosso seletor certifica cobertura não nula em quatro desses seis. No RulingBR, o limite mais apertado que o MSP alcança varrendo todo limiar é b* = 0,211 — e mesmo sem correção alguma pela multiplicidade da busca, o piso fica em 0,149, bem acima da meta de 5%. Nosso seletor certifica ali 0,94 de cobertura (0,91 sob calibração independente da seleção do modelo). É a diferença entre um sistema que pode ser implantado sob restrição de risco e um que não pode.

03

Escala não substitui geometria

Um modelo de 7 B com prompt é mais acurado que nosso pipeline de 110 M em resenhas (0,973 vs. 0,971) e ainda assim ordena pior os próprios erros (AURC 0,011 vs. 0,004), a cerca de 2.756 s de H100 por fold contra uma única passada do encoder mais C comparações de cosseno. Sua vantagem decai com a granularidade do espaço de rótulos até que, numa taxonomia de 48 intenções, ele cai abaixo do baseline ajustado que deveria substituir. Nem um encoder multilíngue congelado serve de substituto: ele nos iguala em resenhas genéricas e fica 6,8× atrás em texto jurídico.

04

Identifica um ponto cego metodológico — e o isola como fator de confusão

A literatura da área costuma omitir m, o tamanho do conjunto sobre o qual o limiar é selecionado, embora m governe o limite: o Brands fica em m = 46 contra uma exigência de viabilidade de m ≥ 46, de modo que sua cobertura zero é artefato do tamanho de amostra exatamente na fronteira. Mas então rodamos a varredura que separa m da qualidade do escore, subamostrando o conjunto de calibração de 5% a 100%: sete dos oito corpora ficam em cobertura exatamente zero em todas as frações, incluindo um com m = 21.016. Onde o escore não separa, nenhuma quantidade de dados de calibração recupera cobertura.

05

Amplitude, em dois idiomas, com as falhas reportadas

Doze corpora em português e oito em inglês sob protocolo idêntico, cinco famílias de tarefa, três orçamentos, cinco sorteios cada. Os corpora não foram filtrados por resultados favoráveis: Brands e Eniac certificam cobertura zero para todos os métodos testados e são reportados junto aos demais, assim como o Reuters, o único corpus entre os vinte em que o baseline certifica e nós não.

Não inventamos nem o SGR nem o ajuste fino prototípico. A contribuição é a evidência — em escala, em dois idiomas, com os dois fatores separados — de que essa é a combinação que se sustenta sob extrema escassez de dados (5-shot), e de que a função de confiança que a área vem otimizando não é o que carrega o efeito.

Escopo, como em toda essa página: a grade detalhada cobre quatro corpora, embora a escada que ela resume seja medida nos doze; seus protótipos do encoder baseline são construídos com exemplos de validação, e não com o conjunto de suporte de treino — um desvio que favorece o baseline. A escada é monótona pela mediana nos doze corpora em português e pela média nos oito em inglês, não corpus a corpus.

Método

Um pipeline de módulos desacoplados

Aprendizado de representação, atribuição de escore e limiarização calibrada por risco são etapas independentes, então a regra final se aplica independentemente do que acontece antes — e qualquer ganho na ordenação da confiança se converte diretamente em mais cobertura a um risco-alvo fixo.

PIPELINE DE MÓDULOS DESACOPLADOS texto de entrada Encoder BERTimbau, 6 camadas fixas tokens Protótipos episódicos o ingrediente operante espaço latente Escore geométrico κ(x) = maxc τ cos(z, μc) confiança Limiar SGR inversão binomial em r* κ ≥ θ* κ < θ* Prever Abster
Figura 1 — o pipeline. Um encoder Transformer, um espaço prototípico treinado episodicamente, um escore de confiança geométrico e uma etapa de limiarização SGR que seleciona θ* invertendo um limite de cauda binomial no risco-alvo r* e confiança δ. A calibração nunca vê dados OOD, então a abstenção em classes não vistas é comportamento emergente do limiar, não garantido — que é o que a lacuna de mundo aberto abaixo mede.

1  Representação prototípica episódica

Os protótipos de classe são médias do suporte sobre a representação adaptada por rótulo, μc = (1/K) ∑k z(xc,k), treinados episodicamente com um termo de repulsão entre protótipos somado à entropia cruzada. O backbone que avaliamos (LAQDA) acrescenta um adaptador de rótulos e uma etapa de aumento por vizinhos de consulta, ambos considerados dispensáveis pela nossa ablação; a configuração que recomendamos é o encoder prototípico simples.

(1) z(x) = 0,1 · Aφ(Ĥ(x))CLS + 0,9 · Ĥ(x)CLS

Multiplicar por nove a participação do adaptador nessa mistura, para 0,9, move o AURC em 0,003 — uma ordem de grandeza abaixo do desvio padrão entre folds — logo o resultado da ablação não é artefato do peso herdado.

2  Confiança geométrica

Confiança e predição são lidas da mesma geometria, com uma temperatura τ definida independentemente. Como τ > 0 é um reescalonamento estritamente monótono, ela comprovadamente não pode alterar o AURC nem o conjunto aceito em nenhum limiar. E também não é o mecanismo, como mostra a grade de atribuição: sobre um espaço prototipicamente estruturado, trocar esse escore pelo MSP move o AURC em 0,001. Trate-o como a leitura natural da geometria, não como aquilo que produz o ganho — sobre uma representação não adaptada, o MSP é de fato a melhor leitura.

(2) κ(x) = maxc τ cos(z(x), μc)     f(x) = argmaxc cos(z(x), μc)

3  A regra de limiarização adotada (SGR)

Dado um conjunto de seleção de limiar Sm de tamanho m, um risco-alvo r* e um nível de confiança δ, o SGR faz busca binária sobre quantis de κ, invertendo uma cauda binomial a cada candidato e mantendo o limiar mais permissivo que ainda atende à meta:

(3) b* = sup{ b : ∑j=0kθ C(mθ, j) bj(1−b)mθ−j ≥ δ′ }
(4) θ* = min{ θ : b*(mθ, r̂θ, δ′) ≤ r* },   δ′ = δ / ⌈log2 m⌉

A restrição é livre de distribuição e vale para qualquer escore — mas validade e utilidade se separam. O limite continua válido sob um escore ruim, enquanto a cobertura que ele rende colapsa a zero. Essa lacuna é o objeto do artigo.

Por que a garantia se restringe ao risco em distribuição

Para uma instância OOD, qualquer aceitação constitui erro por definição, ao passo que o procedimento de calibração é realizado exclusivamente com dados em distribuição. Portanto, o limiar calibrado para controlar o risco em distribuição não fornece, por si só, uma garantia sobre o comportamento fora de distribuição. A rejeição de classes não observadas depende de sua posição relativa na geometria do espaço de representação e de sua consequente atribuição de confiança. Neste trabalho, esse comportamento é mensurado empiricamente, sem que se atribua ao método uma garantia de rejeição OOD. Os resultados evidenciam limitações relevantes nesse cenário.

Resultados

Classificação seletiva em doze corpora

Todos os baselines post-hoc compartilham um encoder ajustado idêntico e diferem apenas no escore de confiança. A comparação abaixo é contra o MSP, o mais forte dos sete, na sua configuração de varredura oracular — selecionada no conjunto de teste, vantagem que não concedemos ao nosso pipeline.

Área sob a curva de risco–cobertura, 5-shot

Média sobre 5 folds. Menor é melhor. Calculada sobre a mistura completa ID + OOD.
Métrica
Nosso (prototípico + SGR) MSP com varredura oracular (melhor baseline post-hoc)
Tabela 1. Classificação seletiva a 5-shot, média sobre 5 folds. O E-AURC subtrai o AURC que um ordenador ótimo alcançaria à mesma taxa de erro. O nosso é melhor nas três métricas nos doze corpora; o E-AURC desconta a acurácia apenas em parte, e a comparação invariante à acurácia está na grade de atribuição.
MSP (varrido)Nosso
Corpus%OODAURCE-AURCAcc (ID)AURCE-AURCAcc (ID)

A acurácia é apenas sobre entradas ID; AURC e E-AURC são sobre a mistura completa ID + OOD, na qual toda entrada OOD conta como erro.

Os maiores ganhos aparecem onde classificadores few-shot convencionais mais falham. O AURC cai 92% no HateBR e 92% no B2WReviews, 89% no RePro e 88% no Brands. O maior ganho isolado é jurídico: o RulingBR vai de 0,450 para 0,073 (−84%), com o maior ganho de acurácia ID do estudo, +45 pontos. A vantagem não se restringe aos dois níveis de risco tabulados — ela vale ao longo de toda a curva de risco–cobertura — e não se explica pela forma superficial, já que um classificador TF-IDF sobre o mesmo suporte é mais fraco que ambos os métodos.

Esse é também o corpus de maior dispersão entre folds, e a média sozinha o descreve mal. No RulingBR o AURC do nosso seletor é 0,073 ± 0,069 com mediana 0,045: um fold registra 0,201 contra 0,012 do melhor. Quem for reproduzir deve esperar essa variação. Nos outros dez corpora o coeficiente de variação fica entre 0,11 e 0,32, e a média descreve bem a distribuição; o Brands é o outro caso assimétrico, mas por ter dois folds com AURC exatamente zero, e não por uma cauda ruim. A dispersão do AURC não se transfere para a cobertura certificada: no RulingBR ela é 0,943, 0,997, 0,956, 0,875 e 0,943 fold a fold.

Essa dispersão é dos dados, não do otimizador — e a variância de otimização, medida, não é desprezível. Refizemos o treino com uma segunda semente nos doze corpora e com uma terceira em três deles, mantendo o suporte fixo, de modo que só a inicialização e a amostragem episódica variam. No IntentPT e no RulingBR a ordenação dos cinco folds por AURC é idêntica nas três sementes: o fold difícil continua difícil sob outra inicialização. Na mediana dos doze, o deslocamento entre sementes é de 0,0015 de AURC, ou 9,7% do desvio entre folds — mas a faixa vai de 0,3% a 100,5% no Buscape, onde o ruído de otimização iguala o desvio entre folds. O Recognasumm é o segundo caso, com 0,0142.

Isso tem duas consequências que preferimos registrar a omitir. O deslocamento entre sementes excede o efeito de trocar o escore em quatro dos doze corpora, de modo que o denominador 0,0023 da razão representação/escore deve ser lido como cota superior da resolução do desenho, e não como medição do efeito. E a margem do numerador não é uniforme: a razão entre o efeito de representação e o deslocamento entre sementes tem mediana de 51, mas cai a 3,5 no Buscape. Uma versão anterior desta análise, sobre três corpora apenas, indicava um mínimo de 19 — estendê-la aos doze deu um resultado pior, e é o dos doze que reportamos.

Os sete baselines post-hoc

AURC nos sete baselines post-hoc

Doze corpora × oito métodos, 5-shot. Mais escuro é melhor.
Tabela 2. AURC ↓ a 5-shot, média sobre 5 folds, os sete baselines post-hoc em sua configuração publicada. Negrito marca o melhor baseline de cada linha; o nosso é menor que todos eles em todas as linhas. †O RePro tem média de quatro folds: o relatório arquivado do fold 01 registra sua acurácia invertida em relação aos próprios logits salvos, então o excluímos uniformemente nos sete scorers.
CorpusMSPEnergyMahal.kNNGradNormReActConjNormNosso

Cobertura atingível a um risco-alvo

Fração das entradas que o sistema responde em vez de adiar, com o limiar selecionado dentro da amostra. Maior é melhor. São pontos de operação, não certificados — ver Certificação.
Orçamento
Risco-alvo
NossoMSP
Tabela 3. Cobertura atingível ao risco-alvo r*, média sobre 5 folds, δ = 0,05, limiar selecionado no conjunto de avaliação pelo mesmo procedimento para ambos os métodos. O MSP está na versão varrida a 5-shot e na configuração publicada a 10-shot, pois a varredura cobre apenas 5-shot. “≈0” é abaixo de 0,01. Cada célula lê MSP → Nosso.
5-shot10-shot
CorpusSGR@5%SGR@10%SGR@5%SGR@10%

Sob essa regra, o nosso lidera o MSP em dez dos doze corpora nos dois níveis de risco, com cobertura média de 0,50 vs. 0,13 a 5% e 0,62 vs. 0,24 a 10% (p = 0,00195 por teste de postos sinalizados de Wilcoxon nos dois níveis, sobre n = 10 pares após descartar os dois corpora em que ambos cobrem ≈0; com dez pares, 2/210 = 0,00195 é o menor valor atingível). Sobre a métrica de AURC, em que nenhum par empata, o mesmo teste dá 0,00049 com n = 12.

Duas linhas que medem o protocolo, não o método — e a varredura que prova isso

O Brands colapsa para ≈0 de cobertura apesar de 0,978 de acurácia porque seu conjunto de seleção de limiar fica exatamente na fronteira de viabilidade (m = 46 contra um limite de m ≥ 46 a 10% de risco). O Eniac colapsa porque a massa de classes OOD retidas impõe um piso de ≈20% ao risco empírico sobre a mistura.

Isso suscita uma ressalva metodológica natural — a hipótese de que o colapso dos baselines também seria artefato de m pequeno. Rodamos a varredura que resolve a questão, subamostrando o conjunto de calibração para 5, 10, 25, 50 e 100% do seu tamanho, com representação e escore fixos: sete dos oito corpora ficam em cobertura exatamente zero em todas as frações, incluindo Recognasumm com m = 21.016 e IntentPT com m = 2.514, ambos ordens de grandeza acima do limite de viabilidade. Só o B2WReviews, que não é degenerado de saída, sobe com m (0,25 → 0,51). Onde o escore carece de capacidade de separação, nenhuma quantidade de dados de calibração recupera cobertura.

Atribuição

Representação ou escore?

A comparação principal muda duas coisas ao mesmo tempo: a representação e o escore de confiança. Uma grade 4×2 as separa, avaliando dois escores sobre quatro representações — um encoder multilíngue congelado, um ajustado convencionalmente, o SetFit e o nosso. Os resultados contrariam a intuição estabelecida.

Escore MSP
Escore cosseno
Encoder CE
0,450baseline da Tabela 1
0,518pior que o MSP
Prototípico
0,072 
0,073nosso pipeline
Na horizontal — muda só o escore: Δ 0,001 Na vertical — muda só a representação: Δ 0,378
Figura 2 — dois degraus da escada no RulingBR (AURC ↓, 5-shot, média sobre 5 folds). As duas células prototípicas vêm da mesma passada direta, então compartilham representação e predição, diferindo apenas em como a confiança é lida.

A grade 4×2, corpus a corpus

Quatro representações × dois escores. As barras mudam entre degraus, não dentro de cada par.
Métrica
Tabela 4. A grade 4×2 completa, 5-shot, média sobre 5 folds. “Congelado” é o melhor entre BGE-M3 e multilingual-E5 por corpus, escolhido no teste, e o CE está no melhor de três taxas de aprendizado, também escolhida no teste — vantagens oraculares concedidas aos baselines, nunca a nós. O SetFit está no melhor de três configurações em B2W e TuPy, escolhida pela AURC de validação. Mudar a representação move os números; mudar o escore dentro de uma representação quase não move.
Repr.EscoreB2WIntentRulingTuPy
AURC ↓
CongeladoMSP0,0140,2170,4980,229
Congeladocos0,0170,2600,5660,322
CEMSP0,0480,2830,4500,167
CEcos0,0640,2930,5180,343
SetFitMSP0,0400,2720,3470,294
SetFitcos0,0280,2680,3540,413
protoMSP0,0040,1150,0720,068
protocos0,0040,1170,0730,066
AUROC correto-vs-incorreto ↑ (sobre entradas ID, invariante à acurácia)
CongeladoMSP0,8480,8290,6880,651
Congeladocos0,7870,7390,5610,512
CEMSP0,8110,8060,7040,600
CEcos0,6910,7760,6190,598
SetFitMSP0,8190,8260,7510,620
SetFitcos0,8440,8280,7370,538
protoMSP0,8980,8760,9360,781
protocos0,9170,8630,9290,779

A representação carrega essencialmente todo o efeito e o escore quase nenhum. Mantendo o escore fixo no MSP, ir do baseline CE para o encoder prototípico leva o RulingBR de 0,450 a 0,072; mantendo a representação fixa, trocar o MSP pelo nosso escore cosseno o move de 0,072 para 0,073. Nos doze corpora, a diferença absoluta média entre os dois escores sobre a representação prototípica é 0,0036 (mediana 0,0023), sem vencedor consistente. O painel invariante à acurácia diz o mesmo: sobre a representação prototípica, os dois escores diferem em no máximo 0,019.

De onde vêm os dois números que a página cita como efeito da representação. Fixando o escore no MSP e trocando só a geometria — do encoder CE para o prototípico, sobre o mesmo backbone —, a mediana nos doze corpora é de 0,056 em E-AURC e de 0,091 em AUROC correto-vs-incorreto. Contra 0,0023 e 0,014 do lado do escore, dão as razões de 24 e 6,5 que delimitam a faixa. O contraste com o encoder congelado não serve aqui, porque troca também a arquitetura base. Uma identidade merece registro, porque a usamos: como cos e MSP compartilham o argmax, a taxa de erro é a mesma nas duas leituras e o termo que a E-AURC subtrai cancela na diferença, de modo que Δ E-AURC = Δ AURC exatamente para o contraste de escore — é por isso que 0,0036 e 0,0023, medidos em AURC, valem também em E-AURC. A identidade não vale para o contraste de representação, em que a acurácia muda, e por isso a coluna de E-AURC daquele lado precisa ser calculada.

Cabe delimitar o que essa célula estabelece. Os dois escores contrapostos ali são funções do mesmo vetor de similaridades aos mesmos protótipos, e que difiram pouco é em parte esperado por construção. O apêndice de variantes amplia o conjunto para cinco estimadores, incluindo o X-Mahalanobis, que lê a mesma geometria por covariância entre camadas e é o único a se destacar — ainda assim a 0,0096 do cosseno, uma ordem de grandeza abaixo do efeito da representação. Os sete escores da grade completa foram avaliados sobre a representação prototípica, e o resultado separa três alegações.

Energy e ReAct convergem; os quatro estruturalmente distintos não. O estimador Energy apresenta diferença de +0,0003 em relação ao cosseno (mediana sobre os doze corpora) e o ReAct +0,0001, resultando em amplitude de 0,0033 entre os quatro escores que leem a geometria prototípica — magnitude equiparável à margem de 0,0023 observada no par cosseno/MSP. Em contrapartida, os quatro escores estruturalmente distintos permanecem atrás: kNN a +0,0439 do cosseno em mediana, ConjNorm a +0,0101, Mahalanobis a +0,0097 e GradNorm a +0,0069, cada um pior que o cosseno em onze ou doze dos doze corpora. Dado que todos preservam a saída argmax prototípica, essas disparidades configuram-se como diferenças de E-AURC, comparáveis ao efeito de representação de 0,056. Ao considerar a amplitude sobre os oito escores, a razão de impacto entre representação e escore é reduzida de 24 para aproximadamente 1,2.

A adaptação da representação reduz o preço de escolher mal. Os mesmos sete escores post-hoc apresentam amplitude mediana de 0,1060 de AURC sobre o codificador de entropia cruzada e de 0,0460 sobre a representação prototípica — redução de 2,3 vezes. É a alegação da progressão de atribuição verificada fora da família de escores que a motivou, e não apenas entre leituras do mesmo vetor de similaridades.

Duas observações delimitam o contraexemplo sem invalidá-lo. O déficit não é uniforme nem propriedade da representação latente: Mahalanobis e ConjNorm chegam a superar o cosseno no RulingBR (0,071 contra 0,073) e ficam muito atrás no Buscape (0,136 e 0,121 contra 0,057). O que os quatro têm em comum é depender de um insumo que o regime raciona — banco denso no kNN, covariância estimável no Mahalanobis, constante de partição amostrada no ConjNorm —, e todos precisam estimá-lo sobre CK exemplos de suporte. Consequentemente, a alegação empiricamente sustentada restringe-se à seguinte: sobre uma geometria adaptada à tarefa, os estimadores providos de condições operacionais adequadas convergem entre si, e o custo de uma escolha ruim cai pela metade — sem que a escolha se torne indiferente.

A escada: quanto o escore importa, conforme a adaptação do espaço

A sensibilidade ao escore cai com a adaptação

Diferença absoluta entre os dois escores lidos da mesma representação, em AUROC correto-vs-incorreto sobre entradas ID. Menor significa que a escolha do escore importa menos.
Português (mediana, 12 corpora) Inglês (média, 8 corpora)
Tabela 18. Diferença absoluta entre os dois escores lidos da mesma representação, em AUROC correto-vs-incorreto sobre entradas ID. Português é a mediana nos doze corpora, inglês a média nos oito.
RepresentaçãoPortuguêsInglês

De nenhuma adaptação até o treino prototípico episódico, a diferença cai de 0,107 para 0,014, um fator de cerca de oito, e a réplica em inglês dá 0,110 para 0,014 nos seus oito corpora. Qual escalar se lê do espaço importa mais justamente onde o espaço nunca foi moldado para a tarefa, e se torna quase irrelevante depois que foi.

Duas ressalvas que declaramos em vez de arredondar. O passo de um encoder congelado para um ajustado convencionalmente não é resolúvel nesse tamanho de amostra (0,107 contra 0,099); só sobrevivem os dois passos que envolvem aprendizado de representação explicitamente estruturado para a tarefa — contrastivo e episódico — e esses estão separados por um fator de quatro. E a escada é monótona pela mediana nos doze corpora em português e pela média nos oito em inglês, não corpus a corpus.

Decompor a diferença por escore diz por quê, e a resposta é unidirecional. Esta decomposição muda de escopo, e o registramos: ela é a média sobre os quatro corpora de aprofundamento da grade 4×2, e não sobre os doze das medianas acima. Nos quatro degraus, o MSP sobe 0,754 → 0,730 → 0,754 → 0,873 enquanto o escore cosseno sobe 0,650 → 0,671 → 0,737 → 0,872. O MSP é pelo menos tão bom quanto o escore cosseno em toda representação e nos dois idiomas; a diferença fecha porque a adaptação resgata a leitura geométrica até apenas empatar. A constatação central não reside na superioridade da nossa função de confiança — que não supera o baseline de forma isolada —, mas sim no fato de que, sobre uma representação adaptada, a escolha da leitura deixa de custar alguma coisa.

REFINAMENTO 01

Encoder congelado: veredito dividido

No B2WReviews ele atinge o menor AURC das quatro representações (0,014) e certifica 0,98 de cobertura sem um único passo de gradiente. Mas no RulingBR colapsa para 0,498 — pior que um BERTimbau ajustado convencionalmente e 6,8× atrás do nosso — sem certificar cobertura alguma. A geometria multilíngue pré-treinada basta para tarefas genéricas de alto recurso e não substitui adaptação nas especializadas.

REFINAMENTO 02

SetFit: similaridade arquitetural é insuficiente

O ajuste fino contrastivo recupera parte do efeito onde o baseline é mais fraco (RulingBR 0,450 → 0,347), mas não nos demais; e, mesmo ajustado oracularmente, fica 7× atrás no B2WReviews e 4,5× no TuPy, sem certificar nada no TuPy, onde certificamos 0,23. Como a representação é reestruturada importa tanto quanto se ela é.

REFINAMENTO 03

Com um exemplo por classe, o SetFit colapsa

Em K = 1 ele é pior que o baseline CE em três dos quatro corpora e certifica cobertura zero em todos, porque seus pares positivos degeneram em pares consigo mesmos quando a classe tem um só exemplo — ao passo que um protótipo episódico segue bem definido, ainda que ruidoso. Declaramos o mecanismo como hipótese: só varremos hiperparâmetros a 5-shot.

Isso não se reduz a “ajuste fino gera um classificador melhor”

A AUROC correto-vs-incorreto é calculada apenas sobre entradas ID e é invariante a quantas o modelo acerta. Contra o baseline da Tabela 1, ela sobe de 0,704 para 0,929 no RulingBR, 0,600 para 0,779 no TuPy, 0,811 para 0,917 no B2WReviews e 0,806 para 0,863 no IntentPT. Parear a acurácia por subamostragem, descartando acertos do modelo mais acurado até igualar o outro e comparando contra o mesmo baseline varrido das tabelas principais, dá AURC 0,029 vs. 0,048 no B2WReviews, 0,252 vs. 0,283 no IntentPT, 0,308 vs. 0,450 no RulingBR e 0,102 vs. 0,167 no TuPy — melhor nos quatro. Restringindo às entradas ID: 0,029 vs. 0,048, 0,157 vs. 0,182, 0,206 vs. 0,340 e 0,102 vs. 0,167. O descarte aleatório é repetido 50 vezes por fold. A vantagem de ordenação sobrevive à remoção completa da vantagem de acurácia, em qualquer das duas populações.

Mas a melhoria é propriedade da geometria aprendida, e atribuí-la à nossa escolha de função de confiança — como fazia um enquadramento anterior desse trabalho — não se sustenta nos dados.

Certificação

De atingível a certificado

Nos doze corpora reexecutamos o pipeline selecionando o limiar no conjunto de validação ID e aplicando-o sem alteração ao teste. Esse conjunto é disjunto do suporte e da avaliação — mas não do procedimento que escolheu o checkpoint, já que a parada antecipada monitora a perda nessa mesma partição. A garantia de Geifman & El-Yaniv exige independência em relação ao classificador, então refizemos a certificação sobre uma partição que nenhuma etapa de seleção de modelo tocou: metade do conjunto de teste calibra, a outra metade mede. A cobertura média cai de 0,569 para 0,538 a 5% de risco, e o risco realizado excede o alvo em 26 de 1.908 células — taxa de violação de 1,4% contra o δ = 5% nominal. É esse número que sustenta a palavra “certificado”; a tabela abaixo mantém a calibração original, que é idêntica para os dois métodos e portanto não favorece nenhum deles.

Cobertura ID certificada, doze corpora

Limiar ajustado na validação ID e aplicado sem alteração ao teste.
Risco-alvo
Tabela 5. Cobertura ID certificada e risco seletivo ID realizado ao risco-alvo r*, 5-shot, média sobre 5 folds, δ = 0,05, nos doze corpora. O MSP está na configuração varrida. “—” marca meta inviável, em que nenhum limiar satisfaz o limite e nenhum risco é definido.
r* = 5%r* = 10%
CorpusMSP cobriscoNosso cobriscoMSP cobriscoNosso cobrisco

Das 120 células corpus-fold-nível, 97 admitem limiar viável e o certificado é violado em duas dessas 97 — taxa de 2,1% contra o δ = 5% nominal. As duas violações são de terceira casa decimal (Buscape fold 02 realiza 0,0503 a uma meta de 5%; HateBR fold 01 realiza 0,1012 a 10%). Células inviáveis ficam fora do denominador e as 97 não são independentes, então isto é uma checagem de consistência contra δ, não um teste binomial dele. Uma média baixa pode significar cobertura pequena em todas as partições ou cobertura razoável em algumas e nenhuma nas demais; a 5% de risco, o nosso seletor admite limiar viável em 5 de 5 partições em oito corpora, 3 de 5 no Buscape e no TuPy, e nenhuma no Brands e no Eniac, enquanto o MSP fica em 0 de 5 em seis corpora.

A ordenação sobrevive à certificação e se amplia. Nosso seletor certifica mais cobertura em dez dos doze corpora a 5% e em onze dos doze a 10%, com cobertura certificada média de 0,569 contra 0,136 e de 0,731 contra 0,278. O MSP não admite limiar viável a 5% em seis dos doze — Brands, Eniac, HateBR, IntentPT, RulingBR e TuPy — enquanto o nosso certifica cobertura não nula em quatro desses seis. As duas exceções são os dois corpora em que todo método colapsa, e os reportamos em vez de omitir: um certificado que devolve cobertura zero é o procedimento se comportando corretamente. As duas linhas zeram, porém, por motivos distintos. No Eniac o escore não sustenta a meta, com m = 580, folgadamente acima do piso. No Brands o conjunto de calibração tem m = 45, abaixo do piso binomial de m ≥ 97 a 5% de risco: ali a cobertura zera por falta de amostra, e um classificador perfeito zeraria igual. Reamostrando a distribuição de escores observada até m = 500, o mesmo modelo certificaria 0,95.

A inviabilidade é propriedade dos valores de confiança, não da busca: varrendo todo limiar do conjunto de calibração, o limite mais apertado que o MSP alcança é b* = 0,211 no RulingBR e 0,068 no IntentPT. Cabe declarar a correção usada nessa varredura: ela mantém δ′ = δ/⌈log2 m⌉, dimensionada para os candidatos que uma busca binária visita, e não δ/m, que seria a correção própria de uma varredura sobre os m quantis — ou seja, a mais permissiva das duas, e o b* reportado é um piso otimista. Levando ao limite, sem correção nenhuma o piso cai para 0,149 no RulingBR e 0,049 no IntentPT. A inviabilidade do RulingBR a 5% independe portanto da correção; a do IntentPT não — ali ela depende de a multiplicidade da busca ser contabilizada, como deve ser em qualquer certificado válido.

Contra o SetFit, nos corpora de aprofundamento

Cobertura certificada contra o SetFit

Quatro corpora de aprofundamento, três métodos. Barras ausentes são metas inviáveis.
Risco-alvo
Tabela 6. Cobertura certificada com uma linha para o SetFit, 5-shot, média sobre 5 folds. O SetFit está na configuração padrão da biblioteca, no escore que a AURC de validação seleciona por corpus; sua própria varredura de configuração alcança 0,80 no B2W. Um alvo infactível — nenhum limiar satisfaz o risco-alvo — é reportado como cobertura 0,00, mesma convenção da Tabela 5.
r*MétodoB2WIntentRulingTuPy
5%CE + MSP0,590,000,000,00
SetFit0,400,070,070,00
Nosso1,000,630,940,23
10%CE + MSP0,820,240,000,00
SetFit0,770,210,190,00
Nosso1,000,861,000,65

A escolha da regra de controle de risco também não é neutra

SGR vs. CRC vs. Learn-then-Test

Cobertura ID certificada sobre a nossa própria representação.
Risco-alvo
Tabela 7. Cobertura ID certificada sob três regras de controle de risco sobre a nossa representação, 5-shot, média sobre 5 folds, calibradas no conjunto de validação ID. O CRC nunca fica abaixo do SGR e está estritamente acima em nove dos doze nos dois níveis; o LTT fica abaixo do SGR em oito.
r* = 5%r* = 10%
CorpusSGRCRCLTTSGRCRCLTT

CRC ou SGR: a escolha é condicional, não uma recomendação geral

O CRC obtém sua vantagem por não pagar pela busca de limiar, o que só é válido quando o risco seletivo é monótono no limiar — condição que o risco seletivo não garante em geral. Essa condição é testável nos conjuntos de calibração que já temos, então a medimos em vez de assumi-la: sobre 200 quantis de limiar por fold, a maior violação média nos doze corpora é 0,0061, com sete abaixo de 0,003 e pior caso de 0,0207 no Eniac. Nessas magnitudes, o risco empírico é monótono no limiar a menos de ruído amostral.

A diferença se concentra onde a correção de união do SGR custa mais: no Brands, cujo m = 45 fica um ponto abaixo do limite de viabilidade do SGR a 10%, o CRC transforma um 0,000 certificado em 0,933 — ou seja, parte do que atribuímos a m pequeno é atribuível à correção. O LTT, que controla a busca com correção de Bonferroni, fica abaixo do SGR em oito dos doze corpora a 5% de risco, empata em três e o supera apenas no Buscape.

A ressalva que decide entre as duas regras não é a monotonicidade, e sim a forma da garantia. O SGR e o LTT dão garantias PAC — limitam Pr(R > r*) por δ sobre o sorteio da calibração — ao passo que o CRC controla o risco em esperança sobre esse mesmo sorteio. Exigir esperança é estritamente menos que exigir alta probabilidade, e parte da cobertura extra do CRC decorre de exigir menos, não de ser um procedimento melhor. A regra prática é uma só: use o CRC quando o compromisso for com o risco médio do sistema ao longo de muitas implantações e m for pequeno o bastante para a correção de união do SGR colapsar a cobertura; use o SGR quando o compromisso for com esta implantação, sobre esta calibração. O CRC cobre mais porque promete menos, e não substitui o SGR onde a promessa mais forte é a exigida.

O número de que mais se precisa na prática: certificado ≠ seguro sob deslocamento

Aplicados à mistura completa ID + OOD, os mesmos limiares certificados aceitam 0,86 do RulingBR a r* = 5% — e, como entradas OOD aceitas são erros por definição, o risco realizado vira 15,2% contra uma meta de 5%, e 23,2% contra 10%. No IntentPT o par é 10,0% e 20,7%. Equivalentemente, o limiar de 5% admite 52% de todas as entradas OOD do RulingBR.

O mecanismo é aritmético e corre ao contrário da intuição: o limiar é escolhido para atender a uma meta de risco em distribuição, então uma geometria ID mais limpa ganha um limiar mais permissivo, e um limiar permissivo admite OOD independentemente de quão bem o escore o ordene. O RulingBR tem a melhor separação ID/OOD do estudo (AUROC 0,893) e ainda assim admite 52% do OOD; o IntentPT separa pior (0,797) e admite 19%. Uma boa representação ID compra cobertura, não segurança em mundo aberto, e as duas podem andar em direções opostas no mesmo corpus.

Réplica translíngue

Oito corpora em inglês, protocolo idêntico

Todo resultado principal acima é em português brasileiro, então a atribuição poderia ser propriedade do idioma, dos corpora ou do encoder. Repetimos o pipeline e a grade em oito corpora em inglês com o bert-base-uncased no lugar do BERTimbau — mesmos folds, mesmo suporte, mesmo conjunto de calibração, mesmo código do SGR, de modo que o idioma muda e nada mais.

Corpora em inglês: baseline CE vs. nosso

Protocolo idêntico, bert-base-uncased no lugar do BERTimbau.
Métrica
Tabela 8. Corpora em inglês, 5-shot, média sobre 5 folds. O baseline CE recebe a mesma varredura oracular de três taxas de aprendizado, escolhida no teste, que recebe em português. As duas últimas colunas são a AUROC de separação ID/OOD (a AUROC correto-vs-incorreto é a escada da Tabela 18); ela é indefinida para o SST-2, cujas duas classes ID não deixam partição OOD.
AURC ↓AUROC ID/OOD ↑
CorpusCENossoΔ%CENosso

Redução mediana de 56,8% contra 66,9% em português; Wilcoxon p = 0,0078, o menor valor atingível com n = 8, com diferença pareada mediana de 0,127 (bootstrap 95% [0,077, 0,191]). A margem menor é a direção esperada: o bert-base-uncased é um ponto de partida mais forte para o inglês do que o BERTimbau é para os domínios especializados em português.

Cobertura certificada em inglês, r* = 5%

Folds inviáveis contribuem cobertura zero para a média.
Tabela 9. Cobertura ID certificada a r* = 5% nos corpora em inglês, 5-shot. “viáv.” conta os folds que admitem limiar viável; folds inviáveis contribuem zero para a média. O nível de 10% não foi armazenado por essas execuções.
MSPNosso
Corpuscobviáv.cobviáv.

O único caso, em qualquer dos idiomas, em que o baseline certifica e nós não

No Reuters a ordenação se inverte: o MSP encontra limiar viável em um dos cinco folds e nosso seletor em nenhum. O StackOverflow é inviável para ambos. Esses são os dois corpora em inglês com a pior razão entre tamanho de calibração e cardinalidade de rótulos (34 e 251 classes ID), e os dois em que nossa vantagem de AURC é menor (29,8% e 21,6% contra 53–91% nos demais) — coerente com o certificado ser mais difícil justamente onde o escore separa menos, embora com dois corpora não seja possível distinguir isso do acaso. Reportamos em vez de restringir a tabela às sete linhas favoráveis.

Análise

Orçamentos, OOD, ablação, backbones, LLMs

Efeito do orçamento de exemplos

AURC versus orçamento K

Média sobre 5 folds, barras de um desvio padrão. O MSP está na configuração publicada nos três orçamentos, pois a varredura oracular cobre apenas 5-shot. Note a escala vertical própria de cada painel.
NossoMSP
Tabela 17. AURC ↓ versus orçamento K nos doze corpora, média ± desvio sobre 5 folds. O MSP está na configuração publicada nos três orçamentos. Todas as células são recomputadas a partir dos logits de teste salvos, o que dispensa a exclusão de fold descrita na Tabela 2: por isso a célula do RePro a 5-shot é 0,083 sobre cinco folds, e não 0,070 sobre quatro.
Corpus / método1-shot5-shot10-shot

Nas 36 células da grade, a AURC do nosso método é menor que a do MSP, com redução mediana de 73,1% a 1-shot, 78,2% a 5-shot e 59,8% a 10-shot. A vantagem é maior sob escassez extrema, coerente com o mecanismo: em K = 1 o protótipo não adaptado é o único embedding de suporte, sem média para amortecer o ruído da representação. A maior margem absoluta é a do RulingBR a 1 e a 5 exemplos (0,68 e 0,41 de AURC) e a do Eniac a 10 (0,18). A leitura de que a margem encolhe com o orçamento vale para a diferença absoluta; em razão relativa a ordenação não é monótona.

Detecção de OOD sob retenção de classes

Detecção de OOD sob retenção de classes

Os cinco corpora com classes retidas, 5-shot.
Métrica
Tabela 10. Detecção de OOD a 5-shot nos cinco corpora com classes retidas, médias sobre 5 folds.
AUROC ↑FPR@95 ↓
CorpusMSPNossoMSPNosso
Eniac0,5530,6850,9280,803
Recognasumm0,6570,7700,8640,794
IntentPT0,6790,7970,8710,771
MMLU-PT-BR0,7020,8040,8610,787
RulingBR0,5550,8930,9310,472

Rejeitar OOD próximo a partir de protótipos few-shot é apenas parcial — a FPR@95 fica acima de 0,77 em quatro dos cinco corpora, e só no RulingBR cai abaixo da metade (0,472). Mas essa dificuldade é específica do protocolo de retenção de classes, que produz OOD próximo por construção: classes retidas e mantidas compartilham domínio, registro e boa parte do vocabulário. Substituir as classes retidas por texto de um domínio não relacionado, sem tocar no checkpoint, eleva a AUROC a 0,986 no Eniac e 0,997 no RulingBR. O OOD distante está praticamente saturado para essa geometria.

Ablação

Ablação no IntentPT

As hastes são um desvio padrão entre folds.
Tabela 11. Ablação no IntentPT (48 classes), AURC ↓, média ± desvio sobre 5 folds. As quatro configurações superam todos os baselines post-hoc nesse corpus por larga margem (0,105–0,119 contra 0,283 do MSP varrido).
Configuração1-shot5-shot10-shot
Completa (adaptador + QDA),138 ±,020,117 ±,027,113 ±,026
Sem amostrador QDA,134 ±,017,105 ±,023,103 ±,021
Sem encoder de rótulos,139 ±,015,119 ±,026,113 ±,024
Prototípico simples,131 ±,018,107 ±,024,106 ±,024

O adaptador de rótulos é dispensável — e isso torna o achado mais forte

Um encoder prototípico simples — sem semântica de rótulos, sem aumento por consultas — reproduz o LAQDA completo nos doze corpora, AURC médio de 0,075 contra 0,074, diferindo em 0,004 em média e menor em seis dos doze. O ingrediente operante é o ajuste fino prototípico episódico — e, pela grade de atribuição, tampouco é o escore com que ele é lido. Os ganhos de cobertura não dependem de um adaptador específico, e a alavanca está disponível a qualquer pessoa que já use redes prototípicas.

Quanto depende do encoder?

Controles de backbone e de leitura

Mesmos folds, conjuntos de suporte e protocolo de calibração.
Tabela 12. AURC ↓ a 5-shot, média sobre 5 folds: o baseline MSP varrido, nosso pipeline em BERTimbau, o mesmo pipeline em XLM-R base e uma sonda logística sobre embeddings congelados, no melhor entre BGE-M3 e multilingual-E5 por corpus escolhido no teste. Os quatro compartilham folds, conjuntos de suporte e protocolo de calibração.
CorpusMSPNossoXLM-RCongelado + sonda

Dois controles, e ambos contrariam uma leitura sem ressalvas. O mecanismo não é independente do encoder: o XLM-R ainda supera o baseline varrido em nove dos doze corpora, mas seu AURC médio é 0,194 contra 0,074 do BERTimbau, com as perdas concentradas em texto coloquial brasileiro de resenhas e redes sociais (TuPy 0,550 vs. 0,068; Buscape 0,308 vs. 0,047) — justamente o registro que um encoder específico do português melhor atende. Nos três corpora em que os encoders se aproximam, a diferença fica dentro da dispersão entre folds (Recognasumm 0,137 vs. 0,136; RulingBR 0,075 vs. 0,073; IntentPT 0,114 vs. 0,117). E uma leitura treinada sobre um espaço congelado rende aproximadamente o que rende o ajuste fino supervisionado do encoder inteiro (média 0,203 contra 0,219), mas não fecha a distância até o treino episódico, falhando exatamente nos corpora especializados em que a leitura por centroides falha.

Contra um LLM de 7B com prompt — e contra TF-IDF

LLM com prompt e baseline lexical

Três corpora abrangendo 2, 10 e 48 classes.
Métrica
Tabela 13. Um baseline lexical (TF-IDF + regressão logística sobre os mesmos K exemplos) e o Qwen2.5-7B-Instruct com prompt contra nosso pipeline e o baseline MSP varrido, 5-shot, médias sobre 5 folds. O LLM lê uma distribuição categórica dos logits dos tokens de resposta, sob os mesmos folds, conjuntos de suporte e conjunto de calibração.
CorpusMétodoAURC ↓E-AURC ↓Acc ↑
B2WReviews
2 classes
TF-IDF0,1050,0790,781
MSP0,0480,0360,855
Qwen2.5-7B0,0110,0110,973
Nosso0,0040,0030,971
RulingBR
10 classes
TF-IDF0,6480,3100,388
MSP0,4500,1950,495
Qwen2.5-7B0,1920,0780,735
Nosso0,0730,0220,944
IntentPT
48 classes
TF-IDF0,4150,1450,457
Qwen2.5-7B0,3850,1540,512
MSP0,2830,1170,607
Nosso0,1170,0570,849

Três conclusões. A premissa que estávamos dispostos a assumir é falsa: logits de tokens de resposta dão sim um sinal seletivo utilizável, e no B2WReviews o LLM atinge cobertura atingível de 1,00 a 5% de risco contra 0,59 do MSP. Esse corpus isola nossa tese central melhor que qualquer ablação nossa — o LLM é mais acurado ali e ainda assim pior em AURC, então toda a nossa vantagem está na ordenação dos erros. Segundo, essa competitividade decai com a granularidade dos rótulos até que, numa taxonomia de 48 intenções, ele cai abaixo do baseline ajustado; ambas as diferenças sobrevivem ao E-AURC. Terceiro, a assimetria de custo não diminui: 2.756 ± 537 segundos de H100 por fold do RulingBR, porque cada entrada exige atenção sobre todo o conjunto de suporte no contexto.

Um quarto corpus separa dois tipos distintos de falha. No MMLU-PT-BR (45 classes) a acurácia ID do LLM desaba para 0,089 — e, ainda assim, seu E-AURC, que desconta a acurácia, é 0,106, essencialmente o 0,094 do MSP. A confiança continua ordenável; o que o modelo não consegue é recuperar uma convenção de rotulagem (matérias separadas por nível de ensino) que nosso pipeline infere dos mesmos cinco exemplos por classe.

Variantes de escore e calibração

Variantes de escore sobre a mesma representação

Média nos doze corpora a 5-shot.
Tabela 14. AURC médio e ganho médio sobre o MSP para cada variante de escore de confiança sobre a mesma representação prototípica, média nos doze corpora a 5-shot. O comparador é o MSP na configuração varrida por oráculo (média 0,2181 nos doze), o mesmo da Tabela 1. Quatro casas porque a dispersão entre variantes está na terceira: as cinco cabem em 0,011 de AURC. Nenhuma variante é universalmente superior, então as tabelas principais reportam o escore cosseno base em vez do melhor por corpus — o que equivaleria a selecionar no conjunto de teste.
EscoreAURC ↓Ganho vs. MSP ↑
Margem0,0723+0,1458
TempScale0,0725+0,1456
MC Dropout0,0727+0,1454
Cosseno (reportado)0,0737+0,1444
X-Mahalanobis0,0833+0,1348

A dispersão estreita é a atribuição vista de outro ângulo: uma vez estruturado o espaço, a escolha do escore é quase imaterial. Os ganhos são de ordenação, não de calibração — o escore cosseno não é uma probabilidade e seu ECE é ruim (0,316 no B2WReviews contra 0,038 do MSP na configuração publicada — é a única comparação desta página que não usa o MSP varrido, porque calibração e ordenação não se movem juntas sob a varredura). O escalonamento por temperatura sobre as mesmas similaridades recupera a calibração e até melhora sobre o MSP ali (0,010), embora não uniformemente (0,115 no IntentPT contra 0,046). Prefira o TempScale quando forem necessárias probabilidades calibradas a jusante.

Tamanho do conjunto de calibração m

Tamanho m do conjunto de calibração, escala log

As linhas tracejadas marcam a viabilidade: m ≥ 46 a 10% de risco, m ≥ 97 a 5%.
Tabela 15. Tamanho do conjunto de seleção de limiar, fold 01. As execuções comparativas dos doze corpora selecionam o limiar na partição de teste ID; as execuções certificadas usam a validação ID. m varia em três ordens de grandeza. A viabilidade com zero erros observados exige m ≥ 46 a r* = 10% e m ≥ 97 a 5%.
CorpusValid. IDm (teste ID)Cob. certificada @5%, subamostrada 5% → 100%

A última coluna é a varredura de cobertura versus m com representação e escore fixos, média de cinco sorteios por fração. Se o colapso fosse artefato do tamanho de amostra, cada linha subiria da esquerda para a direita; só o B2WReviews sobe. Traços marcam corpora fora da varredura.

Escopo — o que esses números não estabelecem

Apenas as execuções certificadas carregam a garantia. Toda cobertura atingível seleciona o limiar na partição de avaliação e é um limite superior do que o SGR poderia certificar sobre aquela mesma população. As duas não são comparáveis termo a termo e nenhuma limita a outra, pois são medidas sobre populações diferentes.

O protocolo de OOD é a retenção de classes, que produz OOD próximo por construção e não cobre nem OOD distante nem deriva temporal ou adversarial. As tabelas principais usam uma única semente (42), de modo que os desvios padrão ali medem sensibilidade à partição dos dados, não à inicialização; medimos o que isso omite refazendo o treino com outra semente nos doze corpora, e com uma terceira em três deles (ver abaixo). A grade detalhada cobre quatro corpora, embora a escada que ela resume seja medida nos doze, Os protótipos do encoder CE eram construídos com exemplos de validação, e não com o suporte de treino, porque os checkpoints originais não tinham sido preservados; retreinamos o baseline guardando as features de suporte e a ordenação da grade não muda — sobre a representação CE o cosseno continua pior que o MSP nos quatro corpora. A comparação com LLM cobre um único tamanho de modelo e um único protocolo de elicitação; o LLM muito provavelmente viu esses corpora públicos no pré-treino, um confundidor que o favorece. Ambos os encoders base são da família BERT, e resta em aberto se os ganhos persistem com encoders maiores.

Reprodutibilidade

Executando o framework

O código-fonte, a configuração de divisões (ood_splits.json), os scripts de benchmark e os resultados por fold que sustentam cada tabela estão no repositório. Os hiperparâmetros são padrões de referência fixos, mantidos constantes nos doze corpora e três orçamentos — quem recebe as varreduras oraculares são os baselines, não o nosso pipeline.

1

Ambiente

uv para instalação nativa (recomendado em cluster / DGX), ou Docker com suporte a GPU.

make setup-env
source .venv/bin/activate
# ou: make laqda-install && docker compose up laqda
2

Divisões ID / OOD determinísticas

Gera configs/ood_splits.json, mapeando cada corpus e fold. A divisão ID/OOD é reamostrada por fold, então os cinco folds capturam a variância de quais classes são retidas.

python main.py
3

Treino — encoder prototípico com SGR

Sem --use_sgr o modelo opera com 100% de cobertura. Com a flag, um limiar crítico θ* é estimado e salvo, e o modelo se abstém abaixo dele.

python -m methods.laqda.cli.train \
    --dataset_dir data/datasets/datasets-br-nlp/intent/IntentPTCorpus/few_shot \
    --fold 01 --kshot 5 \
    --save_dir outputs/laqda_sgr/IntentPTCorpus/fold_01 \
    --use_sgr
4

Baselines sob um encoder idêntico

Uma execução avalia os sete escores post-hoc — MSP, Energy, Mahalanobis, kNN, GradNorm, ReAct, ConjNorm — sobre o mesmo encoder ajustado.

python -m methods.baselines.cli.train_baseline \
    --dataset_dir data/datasets/datasets-br-nlp/intent/IntentPTCorpus/few_shot \
    --fold 01 --kshot 5 \
    --save_dir outputs/baseline/IntentPTCorpus/fold_01
5

Benchmark completo e consolidação

Os scripts SLURM submetem todos os algoritmos nos folds 01–05 e orçamentos K ∈ {1, 5, 10}; o compare.py agrega médias ± desvios entre folds e gera os relatórios.

bash scripts/run_all_pt.sh          # submete a grade
python scripts/compare.py --corpus RulingBRCorpus --plot
make test-baselines                 # testes dos scorers

Organização do repositório

configs/  configuração de modelo, métodos e divisões OOD
data/  datamodules e amostradores episódicos k-shot
methods/
  laqda/  encoder com rótulos, amostrador QDA, perda contrastiva, CLI de treino/inferência
  baselines/  MSP, Energy · distance/ Mahalanobis, kNN · sota/ GradNorm, ReAct, ConjNorm
  sgr/  controle de risco por inversão binomial e limiarização post-hoc
  metrics/  Acc, F1, ECE, AUROC, FPR@95, AUPR, AURC, E-AURC
scripts/  submissão SLURM, agregação, ablação e verificações do artigo
tests/  testes matemáticos e de integridade de cada scorer

Configuração fixa

Tabela 16. Padrões de referência, deliberadamente não ajustados por corpus.
ComponenteConfiguração
EncoderBERTimbau base cased (pt) / bert-base-uncased (en), 6 primeiras camadas congeladas
OtimizaçãoAdamW, lr 2×10⁻⁵, weight decay 10⁻³, ≤100 épocas, parada antecipada (paciência 7)
Episódios100 por época; K∈{1,5,10} de suporte, ≤25 de consulta por classe
Adaptadorρ=15, τtr=20, τ=15, t=5 — todos considerados dispensáveis
SGRδ=0,05, r*∈{0,05, 0,10}, busca binária sobre quantis de calibração
Protocolo5 folds; semente 42 nas tabelas principais, com uma segunda semente nos doze corpora e uma terceira em três deles para medir a variância de otimização; ≈40% das classes retidas como OOD nos corpora multiclasse (≈20% das instâncias de teste)
Citação

BibTeX

A entrada abaixo é um marcador para a submissão anonimizada; será substituída pela referência publicada em caso de aceite.

@inproceedings{selective_risk_ptbr,
  title     = {Classificação Seletiva em Texto Few-Shot:
               O Ganho Vem da Representação, Não do Escore de Confiança},
  author    = {Anonymous},
  booktitle = {Under review},
  year      = {2026},
  note      = {Código: https://github.com/beatrizalmeidaf/selective-risk-framework}
}

Blocos que adotamos

SGR — Geifman & El-Yaniv, Selective Classification for Deep Neural Networks, NeurIPS 2017.
CRC / Learn-then-Test — Angelopoulos et al., controle conforme de risco.
LAQDA — Liu et al., 2024.  SetFit — Tunstall et al., 2022.  Prototypical Networks — Snell et al., NeurIPS 2017.
BERTimbau — Souza et al., BRACIS 2020.  XLM-R — Conneau et al., ACL 2020.
MSP — Hendrycks & Gimpel, ICLR 2017.  Energy — Liu et al., NeurIPS 2020.  kNN — Sun et al., ICML 2022.

Considerações éticas

A classificação seletiva funciona como mecanismo de segurança, mas um risco-alvo declarado pode induzir viés de automação: a garantia está estritamente condicionada a dados de calibração ID i.i.d. e não protege contra deslocamento de distribuição entre as predições aceitas — em nossas próprias execuções certificadas, uma garantia ID de 5% rende 15,2% de erro realizado quando classes não vistas entram no fluxo. A abstenção também levanta implicações de justiça: se grupos demográficos ou dialetais específicos estiverem sub-representados no conjunto de suporte, suas entradas podem ser rejeitadas desproporcionalmente. Recomendamos auditar a cobertura estratificada por subpopulação antes de qualquer implantação. Todos os conjuntos de dados usados são públicos; os corpora de discurso de ódio contêm linguagem inerentemente ofensiva, tratada aqui exclusivamente para pesquisa voltada a melhorar sistemas de moderação.