
GRS vs BARS: diferencias, sesgos y ejemplos para evaluar desempeño
Actualizado: hace 7 días
La diferencia entre GRS y BARS está en cómo se define cada calificación. Una GRS permite valorar una dimensión mediante una escala con grados o etiquetas; una BARS vincula sus niveles con ejemplos de conducta desarrollados para el trabajo que se evalúa. GRS suele requerir menos preparación. BARS exige más diseño, pero puede hacer más explícito qué comportamiento corresponde a cada nivel.
Ninguna de las dos elimina los sesgos. Para elegir, importa qué necesitas evaluar, qué evidencia puedes reunir y cuánto trabajo puedes dedicar al diseño y a la capacitación. Aquí encontrarás una comparación rápida, ejemplos y criterios para decidir entre GRS, BARS y una escala híbrida.
En este artículo: |
GRS vs BARS: comparación rápida

Criterio | GRS | BARS | Cuándo conviene |
Qué califica | El grado de desempeño en una dimensión definida. | El desempeño frente a anclas de conducta por nivel. | GRS para una base simple; BARS cuando necesitas descripciones específicas. |
Cómo se expresa | Números o etiquetas como cumple o supera. | Números acompañados de ejemplos observables. | El número de puntos no distingue por sí solo ambos formatos. |
Riesgo principal | Que distintas personas interpreten de forma diferente las etiquetas. | Que las anclas sean ambiguas, incompletas o poco representativas. | En ambos casos, revisar evidencia y practicar con casos comunes. |
Esfuerzo inicial | Generalmente menor, sin omitir criterios ni formación. | Mayor: análisis del puesto, incidentes, paneles y pruebas. | Elegir según recursos, diversidad de roles y consecuencias de la decisión. |
Ejemplo de evidencia | Un nivel justificado con hechos del período. | Hechos contrastados con las conductas de los niveles. | Usar registros del trabajo y explicar la calificación. |
No confundas una GRS con una nota global obligatoria: también puede evaluar varias dimensiones por separado. Tampoco basta con escribir una conducta junto a un número para afirmar que ya tienes una BARS validada. El proceso de construcción y la evidencia sobre su uso son parte de la diferencia.
Qué medir y cómo comprobar la calidad de la escala

Antes de elegir el formato, define el desempeño que quieres observar. El desempeño de tarea comprende las actividades propias del puesto; el contextual incluye contribuciones que ayudan a que el trabajo colectivo funcione, como coordinar, cooperar o compartir información relevante. Ambos pueden evaluarse por separado, con GRS o con anclas conductuales.
Si solo miras resultados, puedes perder información sobre cómo se consiguieron. Si solo miras conductas, puedes pasar por alto lo que se logró. La escala debe integrarse en un sistema de evaluación de desempeño laboral con criterios, evidencia, feedback y seguimiento.
Validez y fiabilidad cumplen funciones distintas
Validez de contenido: los criterios representan tareas y conductas relevantes del puesto.
Relación con criterios externos: cuando el uso lo requiere, se comprueba cómo se relacionan los puntajes con resultados pertinentes. Hablar de validez predictiva exige estudiar resultados posteriores.
Fiabilidad entre evaluadores: se examina cuánto coinciden quienes califican el mismo desempeño con información comparable.
Una escala puede resultar clara y aun así usarse de manera inconsistente. Si dos evaluadores observan el mismo caso y llegan a notas muy distintas, revisa las definiciones, la evidencia disponible y la forma de aplicar el instrumento. La consistencia es necesaria para interpretar los puntajes, pero por sí sola no demuestra que se esté midiendo lo correcto.
Antes de comunicar decisiones, una calibración del desempeño permite contrastar criterios y documentar por qué se mantiene o ajusta una nota. No debe usarse para forzar distribuciones ni para ocultar diferencias reales.
Cómo funciona una GRS y qué sesgos debes vigilar

Una Graphic Rating Scale o escala de calificación gráfica asigna un grado a una dimensión. Un formato habitual utiliza cinco niveles, pero también existen otras cantidades de puntos. Su ventaja operativa es que resulta fácil de explicar y desplegar; la calidad depende de lo que signifiquen sus categorías y de cómo se justifiquen las respuestas.
Por ejemplo, evaluar colaboración con una escala de 1 a 5 y etiquetas como no cumple, cumple o supera puede ser útil como punto de partida. El problema aparece si cada jefe entiende algo distinto por cumple, o si la nota no se acompaña de evidencia.
Halo, indulgencia, severidad y tendencia central
Efecto halo: una impresión general influye en la valoración de dimensiones diferentes.
Indulgencia o severidad: un evaluador puntúa sistemáticamente más alto o más bajo de lo que la evidencia justifica.
Tendencia central: se concentran las respuestas en el medio de la escala sin distinguir suficientemente el desempeño.
Estos errores pueden aparecer en distintos formatos, no solo en GRS. Una concentración de notas tampoco prueba por sí misma que exista sesgo: puede reflejar el desempeño observado, el diseño de la escala o información insuficiente. Antes de corregir, compara casos y explicaciones.
Para reconocer estos patrones y otros errores frecuentes, revisa la guía de sesgos en la evaluación de desempeño. Exigir ejemplos concretos por dimensión ayuda a que la conversación no dependa de impresiones generales.
Cuando hay muchos evaluadores, puedes revisar también cómo TRAKER presenta su software de calibración de evaluaciones con IA. Las alertas deben servir como insumo de revisión; no convierten una nota en correcta sin contrastarla con el trabajo realizado.
Cómo se construye una BARS y cuáles son sus límites

Una Behaviorally Anchored Rating Scale utiliza ejemplos de comportamiento para describir niveles de desempeño. En lugar de dejar un 4 como muy bueno, precisa qué conducta permitiría asignarlo. Por ejemplo: explica una solución, comprueba que la otra persona la comprendió y deja claros los acuerdos. Este ejemplo ilustra un ancla; no constituye una escala validada.
Para construir anclas necesitas hechos del trabajo. Un registro de desempeño permite conservar situaciones observadas durante el ciclo y evita depender únicamente de la memoria al cierre.
Del análisis del puesto a los anclajes
Define las dimensiones relevantes y el uso previsto de la evaluación.
Recoge incidentes de desempeño efectivo e inefectivo con personas que conozcan el trabajo.
Depura ejemplos ambiguos o redundantes sin perder su contexto.
Pide a otro grupo que reclasifique los incidentes en las dimensiones: es la retranslación.
Valora el nivel de efectividad de las conductas y selecciona anclas diferenciables.
Prueba el instrumento con evaluadores y casos; revisa comprensión, consistencia y pertinencia antes de extenderlo.
Qué dice la evidencia sobre los sesgos
La evidencia no permite afirmar que BARS sea siempre superior. En un estudio de Keaveny y McGann sobre evaluación de profesores, las escalas conductuales mostraron menos halo, pero no corrigieron la indulgencia. Es un resultado de ese contexto, no una garantía para cualquier empresa.
Otra comparación con 270 estudiantes no encontró una ventaja psicométrica clara de un formato sobre el otro. La conclusión práctica es comprobar cómo funciona tu instrumento, en vez de asumir que el nombre del método asegura el resultado.
Costo, pérdida de información y propuesta ACB
El trabajo de reunir, clasificar y probar conductas requiere tiempo. Durante la selección pueden descartarse episodios relevantes porque resultan ambiguos o difíciles de asignar a una dimensión. Conviene conservar ese banco para revisar las decisiones de diseño, aunque no todos sus episodios terminen como anclas.
Una investigación publicada en Revista Espacios en 2019 estudió una etapa adicional de agrupación en Aspectos de Comportamiento Básico, o ACB, en evaluación docente universitaria. Agrupar episodios afines buscaba representar más información conductual. Los análisis del instrumento resultante no prueban que esta alternativa reduzca costos ni mantenga la misma calidad en todos los puestos. Puede explorarse con validación local; no sustituye las pruebas del instrumento.
Escalas híbridas y ejemplos de conductas por nivel

Si necesitas aclarar una GRS pero todavía no puedes desarrollar una BARS completa, puedes añadir descriptores conductuales. Es una escala híbrida: ofrece referencias más concretas sin afirmar que ya pasó por el mismo proceso de construcción y validación. Trabajar por familias de cargos puede facilitar el diseño, siempre que sus tareas compartan criterios relevantes.
Nivel | Etiqueta ilustrativa | Descriptor de colaboración |
1 | Por debajo de lo esperado | No comunica a tiempo una dependencia conocida y dificulta que el equipo organice la entrega. |
2 | Cumplimiento parcial | Comparte información cuando se le solicita, pero omite dependencias que debe advertir para coordinar la entrega. |
3 | Cumple lo esperado | Comparte la información necesaria, acuerda responsables y cumple los compromisos de coordinación. |
4 | Supera lo esperado | Anticipa dependencias, avisa con oportunidad y ajusta acuerdos para resolver bloqueos entre áreas. |
5 | Contribución destacada | Además de coordinar su trabajo, desarrolla una mejora reutilizable que facilita la coordinación de otros equipos. |
Adapta estos descriptores al puesto y prueba si los niveles se distinguen de verdad. No califiques a una persona con un único episodio ni le exijas una conducta para la que no tuvo oportunidad. Si falta información, registra esa falta; no la conviertas automáticamente en una nota baja.
Uso en evaluaciones de varias fuentes
En una evaluación de 360 grados, pares, jefatura y colaborador pueden observar aspectos distintos. Define qué puede valorar cada fuente antes de combinar resultados. Esta guía de tipos de evaluación de desempeño ayuda a distinguir el alcance de los modelos de 90, 180, 270 y 360 grados.
Una diferencia entre fuentes no demuestra un error: puede aportar información sobre contextos diferentes. Las anclas y la formación ayudan a comparar criterios, pero no justifican borrar esas diferencias sin examinarlas.
Entrenamiento y calibración para aplicar la escala

Puedes tener descriptores claros y aun así evaluar con poca evidencia. La formación debe enseñar a observar, registrar y justificar notas, además de explicar los errores habituales. Compartir una definición de buen desempeño es tan relevante como elegir el formato.
El metaanálisis de Roch y colaboradores encontró mejoras en precisión con el entrenamiento de marco de referencia, conocido como FOR. Esto respalda practicar con casos y discutir el criterio utilizado; no significa que una capacitación elimine todos los sesgos.
Una práctica útil es pedir a varios evaluadores que califiquen el mismo caso por separado. Después comparan notas, identifican la evidencia que usaron y revisan las diferencias con un criterio previamente definido. Si una frase admite interpretaciones incompatibles, se corrige antes de evaluar a toda la organización.
Puedes ampliar el diseño de esa formación con los entrenamientos RET, FOR y BO. Después, la calibración contrasta los casos reales y deja registro de los acuerdos. La finalidad es mejorar el fundamento de la decisión, no hacer que todos pongan las mismas notas.
Cómo elegir entre GRS, BARS y una escala híbrida

Elige GRS si necesitas una escala común y simple para iniciar, y puedes definir sus dimensiones y exigir evidencia.
Elige BARS si los roles tienen conductas observables y puedes desarrollar y probar anclas con personas expertas en ese trabajo.
Considera una híbrida si necesitas mayor claridad conductual y vas a avanzar por etapas. En los tres casos, incluye capacitación, evidencia y calibración.
Consecuencias de la decisión
Si la evaluación influye en promociones, compensación o desarrollo, aumenta la exigencia de calidad del proceso completo. Las anclas facilitan explicar qué se observó, pero ninguna etiqueta metodológica garantiza por sí sola decisiones justas. Define cómo se revisarán desacuerdos y qué información sustentará cada conclusión.
Diferencias entre evaluadores
Si varios evaluadores califican de manera distinta el mismo caso con la misma información, revisa sus criterios. Si observan situaciones diferentes, primero reúne el contexto. Cambiar de escala sin resolver esa diferencia puede trasladar el problema a un formulario nuevo.
Diversidad de puestos y capacidad de mantenimiento
Cuantos más roles evalúes, mayor será el trabajo de mantener anclas pertinentes. Una familia de cargos puede compartir criterios, pero no debería usar ejemplos ajenos a sus responsabilidades. Reserva tiempo para revisar la escala cuando cambien las tareas.
Además de las conductas, puedes evaluar objetivos y resultados mediante enfoques como la Administración por Objetivos. Es otra decisión de diseño: qué se logró no sustituye cómo se trabajó.
Preguntas frecuentes y próximos pasos

¿BARS siempre es mejor que GRS?
No. Puede aportar claridad cuando las anclas son pertinentes, pero su desempeño depende del diseño y del uso. Compara la calidad de la evidencia, la comprensión de los niveles y la consistencia al calificar casos similares.
¿Cuánto cuesta implementar BARS?
No hay un costo universal. Depende de las dimensiones y roles, de la disponibilidad de expertos y del trabajo de recolección, clasificación, prueba y mantenimiento. Define ese alcance antes de estimar horas o presupuesto.
¿Qué sesgo es el más común en una GRS?
Sin datos del proceso no corresponde elegir uno como el más común. Halo, indulgencia, severidad y tendencia central son riesgos que conviene revisar, pero su presencia debe comprobarse con evidencia.
¿Sirve cambiar una escala de cinco puntos por una de cuatro?
Eliminar el punto medio cambia las opciones de respuesta, pero no corrige automáticamente la tendencia central. Primero define qué significa cada categoría y si una opción intermedia tiene sentido para el desempeño evaluado.
¿ACB equivale a una BARS más barata?
No puede afirmarse como regla. ACB es una propuesta de agrupación de episodios estudiada en un contexto concreto. Antes de adoptarla, comprueba su pertinencia y el trabajo que requiere en tu organización.
¿Puedo usar descriptores conductuales sin validar una BARS completa?
Sí, como una escala híbrida cuyo alcance quede claro. Pruébala, recoge dificultades y mejora los descriptores. No la presentes como un instrumento validado solo porque incluye conductas.
¿Qué debería priorizar al comenzar?
Empieza por una familia de cargos: define dimensiones, reúne evidencia y prueba los niveles con casos comunes. Entrena a quienes evalúan, registra los desacuerdos y corrige las ambigüedades antes de ampliar el uso. El FOR merece atención porque ayuda a aplicar un marco compartido, pero requiere práctica y seguimiento.
La escala cobra sentido cuando lleva a una conversación y a acciones. Conecta la evaluación con feedback, calibración y planes de desarrollo con responsables y seguimiento. El próximo paso no es cambiar todos los formularios: es comprobar si puedes explicar, con evidencia, por qué un caso merece un nivel y no otro.




Comentarios