Encyclopedia
Reference · Satcove Encyclopedia

¿Qué es una puntuación de acuerdo de IA?

Una puntuación de acuerdo de IA es la lectura cuantitativa de cuánto convergió un panel multi-modelo en una respuesta — un número de confianza calibrada.

Updated September 7, 20263 min read

Respuesta en 60 segundos

Una puntuación de acuerdo de IA es el resumen cuantitativo de cuánto convergió un panel multi-modelo en la misma respuesta. Es un número único — típicamente expresado como porcentaje o en una escala etiquetada — que comprime el comportamiento colectivo del panel en una señal de confianza calibrada. Puntuación alta: los modelos se pusieron de acuerdo. Puntuación baja: el panel se dividió.

No es una «probabilidad de que la respuesta sea verdadera». Es una lectura de cuán fuerte fue la señal multi-modelo. Una puntuación alta correlaciona con mayor probabilidad de acierto, pero la relación está calibrada respecto a la estructura del panel, no promovida a verdad absoluta.

Lo que mide

Una puntuación significativa combina tres mediciones.

Cobertura. Qué fracción del panel produjo la afirmación convergente. Cinco de seis es distinto de tres de seis.

Intensidad. Cuán estrechamente coincidieron los modelos que estaban de acuerdo. Acuerdo palabra por palabra > acuerdo vago.

Peso ajustado a la diversidad. Si el acuerdo viene de modelos genuinamente independientes (peso alto) o de la misma familia (peso bajo, correlación por construcción).

Una puntuación seria combina los tres. Una ingenua usa solo cobertura, inflándose ante panel redundante.

Lo que NO es

No es una probabilidad de verdad. Una puntuación alta en un panel que comparte un punto ciego puede estar confiamente equivocada.

No es un score de calidad de los modelos. Un panel con un modelo más débil junto a varios fuertes puede aún producir puntuación alta en preguntas donde el débil acierta el dato fácil.

No es un sustituto de leer la salida real. Una puntuación 92 % con un disidente sobre afirmación clave vale una lectura atenta.

Cómo se calibra

Un score bien calibrado se construye y testea contra un holdout de preguntas con respuesta conocida. Mide: a puntuación X %, ¿qué fracción de afirmaciones convergentes fueron correctas? Eso produce una curva de calibración.

La calibración importa porque sin ella el usuario sobreconfía. Una puntuación 90 % que en realidad corresponde a 75 % de aciertos se confiará en exceso.

La calibración es sensible al dominio. La puntuación que en hechos comunes significa «muy fiable» puede significar menos en especialidades estrechas.

Cómo el usuario debería leer la puntuación

Alta: Los modelos coinciden ampliamente. Comprueba las fuentes y los desacuerdos sobre afirmaciones importantes. El acuerdo puede reflejar un error compartido.

Intermedia: Algunas afirmaciones están en disputa o tienen cobertura incompleta. Compara razones y pruebas; la puntuación no establece por sí sola cuáles son fiables.

Baja: Usa el resultado como mapa de desacuerdo. Identifica contexto faltante, supuestos incompatibles y fuentes que comprobar antes de decidir.

Son orientaciones cualitativas. Cualquier afirmación sobre exactitud para una puntuación requiere un estudio de calibración independiente con respuestas conocidas.

Ideas equivocadas habituales

«Puntuación alta significa que la respuesta es verdadera.» Significa que el panel convergió. Eleva la confianza, no la garantiza.

«Puntuación baja significa sistema malo.» Suele significar pregunta en disputa o cobertura desigual. Reporte honesto.

«Todos los scores son comparables entre preguntas.» No necesariamente. Cross-dominio requiere calibración por dominio.

«Elija siempre las respuestas de score alto.» Lea siempre las divergentes — suelen tener el detalle marginal.

Conceptos relacionados

El consenso de IA es la práctica más amplia. La verificación multi-modelo es la ingeniería. El desacuerdo de IA es la forma cualitativa del extremo bajo. La confianza en la IA es el marco más amplio. La búsqueda de verdad es la pregunta epistémica.

Qué ha medido Satcove

El estudio de desacuerdo de Satcove (en inglés) incluye 75 preguntas exploratorias y 347 respuestas de modelos registradas. Un modelo juez clasificó 30 preguntas con recomendaciones parcial o totalmente divergentes: el 40 % de esta muestra. La página ofrece resultados, metodología y limitaciones. Mide desacuerdo, no exactitud, y no valida ninguna puntuación como probabilidad de verdad. Los ejemplos y umbrales de esta página son ilustrativos, no umbrales de actuación validados.

Preguntas frecuentes

¿Es la probabilidad de que la respuesta sea correcta? No. Es la fuerza del acuerdo multi-modelo.

¿Puede ser errónea la puntuación? Sí. Un modelo juez puede interpretar mal las respuestas, omitir una contradicción o producir una puntuación poco fiable. Incluso un acuerdo bien medido puede coincidir en una afirmación falsa.

¿Actúo igual sobre 95 % que sobre 70 %? Ninguna puntuación autoriza por sí sola a actuar. Comprueba las afirmaciones importantes con fuentes primarias, lee los desacuerdos y consulta a un profesional cuando la decisión lo requiera.

¿Sustituye la puntuación a leer la salida? No. Es guía sobre cómo leerla.

Satcove implements AI consensus by querying six independent models in parallel, comparing their answers, and surfacing where they agree, diverge, and what they collectively could not settle.