Los 7 errores que más se repiten al comparar sucursales y por qué te llevan a decisiones caras

Comparar sucursales parece simple… hasta que un ranking injusto te hace mover headcount, pagar bonos mal o tocar SLAs que no debías. Estos son los 7 errores al comparar sucursales que más se repiten, cómo detectarlos y qué decidir sin quemarte.

Mateo Rojas
Mateo Rojas
12 min de lectura·

El ranking “perfecto” que te hace perder dinero: dónde se rompe primero al comparar sucursales

En la mayoría de redes de sucursales, el ranking se vende como salvavidas: dashboard prolijo, flechas verdes, reunión de performance y una frase que suena eficiente pero es peligrosa: “Listo, movamos dos personas de la sucursal C a la A y ajustemos bonos, porque los números hablan”.

Sí, los números hablan. A veces también tartamudean.

Una “decisión cara” no es debatir un KPI. Es tocar cosas con costo real si te equivocas: staffing y turnos, bonos y castigos, ruteo de casos, SLAs, escalaciones, horarios, incluso “copiar” el proceso de la sucursal top. Cuando fallas no solo se enoja una sucursal: sube el recontacto, aparecen horas extra, se congestionan escalaciones… y el equipo bueno empieza a mirar LinkedIn.

La trampa es sutil: comparar no es lo mismo que medir.

  • Performance local: lo que la sucursal hace con lo que le llega.
  • Efectos del sistema: lo que le llega y bajo qué reglas (ruteo, SLA distinto, backlog heredado, campañas, incidentes, etc.).

Si mezclas ambas cosas, el ranking deja de ser termómetro y se vuelve dado.

Estos son los 7 errores al comparar sucursales que más se repiten, y qué decisiones caras suelen disparar:

  1. No ajustar por volumen: mueves headcount por ruido.
  2. Ignorar el mix (canal/tema/severidad): pagas bonos injustos y castigas al que cargó los casos difíciles.
  3. Creerle al promedio: cambias horarios o SLAs por una cola larga escondida.
  4. Optimizar un proxy equivocado: incentivas cierres rápidos y derivaciones para “cumplir”.
  5. Culpar a la sucursal por fallas del sistema: rompes cultura y no arreglas el cuello real.
  6. Decidir por ranking sin costo total: ahorras en un lugar y pagas el doble en escalaciones, quejas o devoluciones.
  7. Definiciones y calidad de datos flojas: construyes un ranking elegante sobre arena.

Para entender rápido cómo el mix y la atribución te pueden engañar incluso con datos “buenos”, este enfoque lo aterriza bien: [1]

Error #1 y #2: comparar sin ajustar por volumen y sin corregir el mix (canal, temas, severidad)

El error #1 es el más común: comparar promedios como si el volumen no existiera. Pero el volumen cambia todo: colas, variabilidad, backlog, cobertura por franja y hasta el margen de error tolerable.

Ejemplo simple (y realista):

  • Sucursal A atiende 10.000 tickets al mes.
  • Sucursal B atiende 1.000.

En A, una variación chica se multiplica y aparece como cola. En B, esa misma variación puede ni notarse. Si miras solo “tiempo promedio de primera respuesta”, A puede verse peor aun operando bien.

Decisión rule que evita peleas eternas: no compares promedios sin mirar denominadores. En soporte, el denominador es la N: cuántas conversaciones, cuántos casos, cuántas resoluciones.

Y la regla que te salva de rankear humo: si la N es chica, no rankees. En vez de pelear por “quién está último” en una ventana frágil, agrupa por cohorte/periodo/región/tipo de servicio hasta que haya señal. Si una sucursal tiene pocas interacciones en el periodo (y esto pasa más de lo que se admite), un ranking semanal es básicamente una ruleta elegante.

Ahora el error #2: el mix. Mix distinto es trabajo distinto.

  • No es lo mismo facturación que incidentes técnicos.
  • No es lo mismo email (permite investigación) que WhatsApp (presión por inmediatez).
  • No es lo mismo un caso leve que un caso severo con escalación.

Tres sesgos típicos en comparación de sucursales:

  1. Una sucursal recibe más chat/WhatsApp; otra más email. La primera sufre en FRT por franja; la segunda se ve “más prolija”.
  2. Una sucursal absorbe campañas (devoluciones, reclamos post-lanzamiento). Sube volumen y cambia el ánimo del cliente, y eso pega directo en CSAT.
  3. Una sucursal concentra complejidad por ruteo (o por ser “la que resuelve”). Termina con AHT alto y más traspasos aunque su equipo sea más competente.

Esto no significa “entonces no se puede comparar”. Se puede, pero con ajustes mínimos que sigan siendo explicables en comité.

Baseline de normalización que casi siempre alcanza para que el ranking sea justo sin volverse impronunciable:

  • Mide en tasas además de totales (por 100 conversaciones o por 100 casos). El volumen deja de hipnotizar.
  • Separa por canal (mensajería vs email vs teléfono si aplica). Mezclar canales suele producir conclusiones equivocadas.
  • Agrupa por tema y severidad con pocas categorías “de verdad” (5–8 temas, 2–3 severidades). No necesitas taxonomía perfecta; necesitas cortes que cambien el trabajo.

Un truco que baja la política interna en 3 minutos: antes de discutir “quién es mejor”, muestra dos visuales simples:

  • Mix por canal por sucursal.
  • Top de temas por sucursal.

De golpe la conversación cambia de “tu equipo vs mi equipo” a “ok, no estamos viendo el mismo tipo de trabajo”.

Tradeoff real: más justicia implica algo más de complejidad. La clave es que el ajuste se pueda defender con una frase. Heurística útil: dos cortes y una historia.

  • Un corte por volumen (N mínima / cohortes).
  • Un corte por mix (canal + tema).
  • Y una historia clara de por qué eso hace la comparación más justa.

Cuando el comité vive apurado, etiqueta el ranking con honestidad operativa: “apto / revisar / no accionable”. No es burocracia. Es impedir que alguien use un número frágil para justificar un cambio irreversible.

Como referencia de comparación de sucursales desde un ángulo más retail (que ayuda a alinear lenguaje con equipos comerciales), este artículo suma: [2]

Error #3 y #4: creerle a promedios y a métricas “proxy” (cuando esconden colas, recontactos y traspasos)

El promedio es el amigo simpático que te mete en problemas. En soporte, las distribuciones no son “lindas”: hay picos, colas largas y días raros. El promedio suaviza justo donde vive el dolor del cliente.

Por eso, cuando comparas sucursales, la dupla p50/p90 vale más que un promedio.

  • p50 te cuenta el “día normal”.
  • p90 te muestra la cola larga (ese 10% que dispara quejas, escalaciones y desgaste).

Si una sucursal tiene p50 excelente pero p90 terrible, no tiene “un detalle”. Suele tener un problema de variabilidad, cobertura, backlog o ruteo.

Qué mirar para no caer en la trampa del promedio:

  • p50 y p90 de primera respuesta y de resolución.
  • Aging del backlog: no solo cuántos casos hay, sino cuántos superan X horas/días.
  • Franja horaria: una sucursal puede ser buena y aun así caer en 2 horas críticas. El promedio mensual te lo esconde.

Ahora el error #4: optimizar proxies.

Un proxy se parece a lo que quieres, pero no es lo que quieres. “Cierres” como proxy de resolución real. AHT como proxy de eficiencia. Y acá aparece la regla no escrita del soporte: lo que mides y premias, se optimiza… aunque rompa el servicio.

Modo de fallo típico: para “mejorar” tiempo de resolución local, una sucursal transfiere más casos al equipo central u otra sucursal. Su tablero mejora. El sistema empeora. El cliente rebota, recontacta, se recalienta. Y tú terminas premiando al que mejor pateó la pelota a la tribuna.

Dos señales de gaming que suelen venir en combo:

  • Baja FRT pero sube recontacto: responden rápido, pero no resuelven (o responden con plantilla).
  • Baja AHT pero suben traspasos/escalaciones: “atendí rápido” porque derivé antes de hacerme cargo.

Antídoto simple y accionable: ningún proxy entra al ranking si no viene con su “efecto secundario” al lado.

  • Si rankeas velocidad, lee calidad/rebote (recontacto, reaperturas).
  • Si rankeas cierres, lee reaperturas.
  • Si rankeas AHT, lee traspasos y escalaciones.

Esto es donde te quemas: dejar que un KPI “simple” sea el KPI del bono. La organización aprende más rápido que el dashboard; en semanas ya estás pagando por el comportamiento equivocado.

El tradeoff es político, no matemático: métricas robustas son menos “bonitas” y exigen conversación. Pero si vas a mover headcount o tocar bonos, mejor una conversación incómoda que una decisión cómoda y cara.

Una reflexión útil sobre este tipo de lectura simplista (desde otra óptica de evaluación) está acá: [3]

Error #5 y #6: culpar a la sucursal cuando el problema es del sistema (ruteo/política) y decidir sin costo total

El error #5 es el más tóxico para la cultura: confundir performance local con efectos del sistema.

Ruteo, SLAs distintos, backlog heredado, políticas de qué se resuelve localmente y qué se escala… hacen que dos sucursales no estén jugando el mismo juego. He visto equipos pelearse por rankings que medían “quién recibe lo fácil” o “quién opera con promesa más relajada”. Y lo peor: se usa el ranking para presionar, como si la presión arreglara una política de ruteo mal diseñada.

Para separar “sucursal” de “sistema” sin humillar a nadie, basta con sostener estas preguntas en la mesa (y no soltarlas):

  1. ¿El mix por tema/severidad fue comparable, o el ruteo sesgó?
  2. ¿El SLA objetivo fue el mismo?
  3. ¿Arrancaron con backlog similar o una heredó cola vieja?
  4. ¿Hubo campaña/incidente/cambio operativo que pegó solo en una zona?
  5. ¿La cobertura por franja horaria fue comparable en horas pico?

Regla que evita arrepentimientos: no muevas headcount ni bonos sin controlar backlog heredado y mix. Si hoy no lo puedes controlar, no “compenses” con castigos. Compensa con algo reversible.

Y ahí entra el error #6: decidir por ranking sin costo total.

El ranking te muestra “quién cumple”, pero no “cuánto cuesta cumplir”. Una sucursal puede cumplir quemando horas extra, derivando el costo a otra área, o respondiendo con macros que disparan recontacto. Si solo celebras el KPI principal, terminas comprando una mejora aparente con deuda operativa.

Costos que se omiten todo el tiempo en comparación de sucursales:

  • Horas extra y rotación (el costo llega tarde, pero llega).
  • Recontacto (volumen extra que nadie forecastó).
  • Traspasos y escalaciones (congestión del sistema).
  • Quejas, devoluciones, churn (a veces viven fuera del tablero de soporte).

Marco práctico para decidir con menos riesgo: separa acciones reversibles de irreversibles.

  • Reversibles: ajustar cobertura una semana, piloto de ruteo por cohorte, apoyo temporal de supervisión, reglas de escalación más claras, revisar macros.
  • Irreversibles: mover headcount fijo, cambiar esquema de bonos, bajar SLAs públicamente, cerrar turnos, reestructurar responsabilidades.

Decisión defendible cuando la señal es débil: haces una acción reversible hoy y postergas una semana la irreversible, pero con una validación concreta en el medio. No es indecisión; es control de riesgo.

Frase útil para cortar impulsos de “mover gente ya”: “¿qué métrica de costo total podría empeorar si esto sale mal?”. Si nadie puede contestar, todavía no es una decisión lista.

Este punto conecta con un patrón conocido en pricing: tomar decisiones sin costo total te deja “ganando” en un indicador y perdiendo margen igual. En su contexto, este artículo lo explica bien: [4]

Error #7 (y el que lo amplifica todo): definiciones y calidad de datos flojas—cómo detectarlo antes de decidir

Estrategia de asignación Mejor para Ventajas Riesgos Recomendado cuando
Validación de definiciones clave — SLA, FRT, resolución, reapertura, traspaso, recontacto Asegurar lenguaje común en métricas de desempeño Evita malentendidos, comparaciones injustas. base sólida para datos Ignorar diferencias sutiles. resistencia al cambio de definiciones Siempre, antes de cualquier comparación o ranking de sucursales
Muestreo aleatorio de casos — ej. 20 casos / sucursal / semana por cohorte Detectar desviaciones en aplicación de definiciones y calidad de datos Identifica problemas proactivamente. feedback rápido para corrección Muestra no representativa (bajo volumen). sesgo del revisor Se necesita control de calidad continuo y ágil
Recap explícito de los 7 errores y cómo la calidad de datos los amplifica Concientizar al equipo sobre impacto de datos deficientes en decisiones Fomenta responsabilidad. mejora comprensión del 'por qué' de controles Puede ser percibido como repetitivo. no garantiza aplicación práctica Se necesita reforzar cultura de datos y su importancia
Calibración periódica de criterios de evaluación Asegurar que evaluadores aplican los mismos estándares Reduce subjetividad. mejora fiabilidad de mediciones Proceso tedioso (mal estructurado). resistencia a ajustar criterios Hay múltiples personas/equipos involucrados en evaluación de datos
Monitoreo de banderas rojas — cambios bruscos en etiquetas. % 'otros' alto. traspasos anómalos Identificar anomalías que sugieren problemas de datos o definiciones Alerta temprana de errores/manipulaciones. enfoca auditoría Falsos positivos (ruido). ignorar problemas no detectados por banderas Se busca vigilancia automatizada para calidad de datos
Auditoría cruzada de datos entre sucursales Validar consistencia en aplicación de reglas y definiciones Detecta inconsistencias sistémicas. promueve aprendizaje entre pares Requiere tiempo/recursos. puede generar fricciones entre equipos Se sospechan grandes variaciones en interpretación de políticas

Este es el error silencioso: definiciones inconsistentes y calidad de datos floja. Es el amplificador de todos los demás.

Puedes ajustar por volumen y mix, mirar p90 y discutir costo total. Pero si “resuelto” significa una cosa en una sucursal y otra en otra, tu ranking está comparando manzanas con peras… y con etiquetas cambiadas.

Las definiciones que conviene tener escritas (cortas, visibles, versionadas) antes de rankear:

  • SLA (y desde cuándo corre).
  • FRT (y si mide respuesta humana o cualquier respuesta).
  • Resolución (y si se permite cierre por inactividad).
  • Reapertura (y en qué ventana cuenta).
  • Traspaso (qué es traspaso real vs reasignación administrativa).
  • Recontacto (cómo se identifica por cliente y por tema).

Síntomas de “dashboard bonito con datos frágiles”:

  • Saltos bruscos tras cambios de etiquetas o plantillas.
  • % de “otros” alto en temas: si “otros” gana, tu clasificación perdió.
  • Traspasos anómalos sin cambio operativo.
  • Mejoras milagrosas sin acción real.

El antídoto no es esperar perfección. Es validar corto y seguido, antes de que el ranking se vuelva argumento.

Dos prácticas que suelen pagar solas:

  • Calibración periódica: si hay varios evaluadores (operación, QA, BI), se alinean criterios con ejemplos reales. Evita el “yo lo conté como recontacto / yo no”. Si se vuelve tedioso, es señal de que la definición está mal escrita o tiene demasiadas excepciones.
  • Auditoría cruzada entre sucursales: una sucursal revisa una muestra pequeña de otra. No para “cazar” errores, sino para detectar interpretaciones distintas que luego te revientan el ranking.

Y el ritual liviano que evita incendios: revisar si hubo cambios recientes (etiquetas/macros/definiciones), mirar banderas rojas y hacer muestreo aleatorio por cohorte (por ejemplo, 20 casos por sucursal en “WhatsApp severidad alta” o “devoluciones por campaña”). No necesitas más para detectar divergencias de criterio o trampas involuntarias.

Si aparecen discrepancias, el ranking puede seguir existiendo, pero cambia de estatus: no accionable para decisiones irreversibles, sí útil para pilotos.

Cierre: 10 preguntas para que tu próxima comparación de sucursales termine en decisiones defendibles (y reversibles)

La comparación de sucursales no es para coronar ganadores. Es para tomar mejores decisiones con menos costo oculto.

Estas 10 preguntas separan señal de ruido bastante rápido:

  1. ¿Estamos comparando ventanas con N suficiente o rankeando sucursales con poco volumen?
  2. ¿El mix por canal es comparable, o una vive en WhatsApp y otra en email?
  3. ¿El mix por tema y severidad es comparable, o el ruteo está sesgando?
  4. ¿Estamos mirando p50 y p90, o solo promedios que esconden colas?
  5. ¿Qué pasa con el aging del backlog, no solo con el total?
  6. Si una sucursal “mejora”, ¿qué métrica empeoró al mismo tiempo (recontacto, reaperturas, traspasos)?
  7. ¿Hubo cambios recientes de definiciones, etiquetas o plantillas que expliquen saltos?
  8. ¿La diferencia es sucursal o sistema (ruteo, SLA, backlog heredado, cobertura por franja)?
  9. ¿Cuál es el costo total detrás de este ranking (horas extra, escalaciones, quejas, devoluciones)?
  10. ¿La acción que queremos tomar es reversible o irreversible?

Un plan de lunes que funciona cuando la señal no es perfecta: bloqueas una decisión irreversible y lanzas un piloto reversible. Dos semanas de ranking por cohortes y severidad en horas pico, sin tocar bonos, suele darte claridad sin romper nada.

Barra de producción honesta: si logras que el pack pre-reunión se arme en 45 minutos y que el comité postergue una semana cualquier movimiento de headcount hasta validar, ya ganaste dinero aunque nadie lo aplauda.

Fuentes

  1. calypso.ms — calypso.ms
  2. bcnsoft.com.ar — bcnsoft.com.ar
  3. es.linkedin.com — es.linkedin.com
  4. boardfy.com — boardfy.com