Sistemas · SYS-I-103 · Incidente · EC
Investigar un servicio que parece caído
Un cliente informa timeout por nombre. El expediente contiene señales parciales de proceso, socket, petición local, resolución y petición remota obtenidas en momentos concretos.
Contenido de la actividad
EC · Expediente reproducible capturado en un contenedor aislado; el análisis base no ejecuta ni modifica el servicio.
Capacidad
Convertir señales incompletas en hipótesis ordenadas y elegir una prueba de bajo riesgo que reduzca incertidumbre antes de cambiar el sistema.
Enunciado
Reconstruye el incidente con el expediente, decide qué hechos son compatibles con cada hipótesis y defiende una única siguiente prueba antes de proponer cualquier cambio.
Estado inicial
- Dossier de incidente y archivo de evidencias exportados desde un contenedor de laboratorio ya detenido.
- Las salidas están deliberadamente incompletas, pero incluyen hora, origen y comando.
- No existe una respuesta oficial ni una reparación embebida en los materiales.
- El primer análisis debe realizarse sin desplegar un contenedor nuevo.
Límites del sandbox
- Trata las evidencias como solo lectura y no sustituyas direcciones ficticias por infraestructura real.
- No ejecutes cambios ni reinicios para completar huecos del dossier.
- Si propones una prueba activa, delimita host, interfaz, duración y dato que conservaría.
- No compartas logs reales ni credenciales como analogía.
Fases de trabajo
1. Definir el incidente
Separar el síntoma informado de las explicaciones.
- Escribe esperado, observado, perspectiva, línea temporal e impacto.
- Clasifica cada fragmento como hecho, inferencia o cambio.
- Señala qué parte del alcance todavía no está medida.
2. Construir y ordenar hipótesis
Cubrir las capas relevantes sin producir una lista infinita.
- Incluye ramas para proceso, socket, nombre, trayecto/filtrado y aplicación.
- Anota qué pista apoya o debilita cada rama.
- Ordena las tres hipótesis principales y justifica el criterio.
3. Elegir una prueba
Reducir incertidumbre con el menor riesgo.
- Propón una sola prueba de solo lectura.
- Predice un resultado diferente para al menos dos hipótesis.
- Declara perspectiva, comando o consulta, evidencia a conservar y condición de parada.
4. Preparar cambio, verificación y rollback
Evitar que una posible corrección se convierta en otro incidente.
- Describe el cambio mínimo que solo sería razonable tras un resultado concreto.
- Define cómo verificarías desde el cliente afectado y desde el servidor.
- Escribe el rollback y la señal que obligaría a ejecutarlo.
Evidencia que debes conservar
- Informe breve del síntoma e impacto.
- Timeline con hechos e inferencias separadas.
- Árbol de hipótesis ordenado.
- Ficha de la primera prueba discriminante.
- Plan condicional de cambio, verificación y rollback.
Criterios de aceptación
- Hechos e inferencias aparecen separados y cada evidencia conserva hora y perspectiva.
- El proceso existente no se interpreta automáticamente como servicio disponible.
- La resolución de nombre, el socket local y la petición remota se tratan como contratos distintos.
- La primera prueba separa hipótesis relevantes sin cambiar el estado del servicio.
- No se reinicia ni se propone abrir filtrado antes de justificar alcance, riesgo y verificación.
- El plan final incluye cómo confirmar el síntoma original y cómo revertir un cambio fallido.
Decisiones abiertas
- Ordenar hipótesis por probabilidad, impacto o coste de comprobación, siempre que se explique.
- Representar el árbol como tabla, diagrama o texto.
- Proponer una observación adicional distinta de la primera prueba defendida.
Materiales
- Dossier del incidente SYS-I-103Contexto, restricciones y plantilla de investigación sin causa declarada.
- Evidencias SYS-I-103Fragmentos parciales de proceso, socket, nombre y peticiones con hora y perspectiva.
Se guarda solo en este navegador. Puedes descargarlo para enviarlo a Codex junto con los materiales que hayas completado.
Sin borrador guardado.
Revisión y reinicio
Revisión: Codex debe comparar la evidencia con estos criterios, señalar primero el supuesto no demostrado y proponer una sola comprobación siguiente. No hay una solución oficial publicada.
Reinicio: Descargar de nuevo el expediente y las evidencias para iniciar un análisis limpio; el caso base es de solo lectura.
Pistas graduadas
Pista 1 · Pregunta qué demuestra cada señal
- Un PID y un listener no son la misma observación.
- Una petición local y una remota recorren fronteras diferentes.
Pista 2 · Busca una bifurcación
- Una buena prueba produce resultados distintos para dos ramas importantes.
- Repetir una señal ya presente puede añadir poco aunque sea fácil.
Pista 3 · Verifica el síntoma original
- El cierre debe incluir la perspectiva del cliente afectado.
- Añade una señal interna para detectar una recuperación aparente o una regresión.