A
Admin

Run #3447

Cron: Pool Health Check · agent infra-agent-registry

Status
success
Tokens
561 / 2420
Cost
$0.000000
Duration
63.0s
Validation
{
  "ok": true,
  "failed": [],
  "hallucinated": [],
  "context_errors": []
}
Params
{}
Prompt resolved
Tu es un agent de monitoring du pool agencecom.

Lessons pertinentes:
LESSONS APPRISES PERTINENTES :
- L453-HUB: Health endpoints K8s : separer liveness no-DB / readiness DB-1s alert / startup cached
- L328-CROSS-S150-blocD2-deploy: Bloc D2 cache layer DEPLOYED Sprint 2 P2 — REUSE Redis 7.0.15 BSD existing Contabo (skip Valkey doublon) + smoke 5/5 PASS via /api/memory/cache/health endpoint dedie
- L-S199-LL2-V52-SPEC-REVIEW: L-S199-LL2 — Review V5.2 Monitoring spec (3 BLOCKERS + 15 medium + 5 low = 23 findings, GO sous condition)
- L-S199-CROSS-V52-SPEC-DRAFTED: L-S199-CROSS-V52-SPEC-DRAFTED — V5.2 Monitoring event-driven spec push DB
- L-S189-LL2-observateur-recap: L-S189-LL2 — Observateur PHASE 1 recap 13+ cycles SILENT + cron clôture

Donnees pool actuelles:
[missing:pool_status]

CONTRAINTE STRICTE -- Tables autorisees UNIQUEMENT :
- agencecom.agents (id, name, agent_level, status, current_session_id, error_count_last_hour, total_sessions, total_errors, total_cost_usd, quarantined_until, acquired_at, last_released_at)
- agencecom.agent_task_runs (id, agent_id, status, started_at, completed_at, error_message, llm_tokens_in, llm_tokens_out, cost_usd, validation_result)

Toute autre table (v_agents_critical, agent_pool, healthcheck_config, error_log, file_locks, zombie_agents, agent_audit, v_agent_timeout_health, v_agents_timeout_risk, agent_health_log, redis_health_ping, auto_quarantine, missions, health_checks, agent_health, internal) NEXISTE PAS -- ne reference jamais de table absente de cette liste.

Identifie les agents zombies (busy >1h sans completion via started_at + status), error_count_last_hour > 5, ou drift quarantine (quarantined_until > now).
Donne 3 recommandations concretes en markdown bullet points avec actions SQL utilisant SEULEMENT les 2 tables autorisees ci-dessus.
LLM Response
## Surveillance du pool `agencecom` — détection des agents zombies, dérives et seuils d’erreurs

Aucune donnée actuelle du pool n’étant fournie (`[missing:pool_status]`), les recommandations ci‑dessous sont les requêtes SQL à exécuter pour identifier précisément les trois anomalies demandées, **en n’utilisant que les tables `agencecom.agents` et `agencecom.agent_task_runs`.**

### 1. Agents zombies (occupés > 1 h sans achèvement)
Un agent est considéré zombie si une tâche est en cours (`agent_task_runs.status = 'in_progress'`), démarrée depuis plus d’une heure, sans date de complétion, ET que l’agent lui‑même est marqué `busy`.

```sql
SELECT a.id, a.name, a.current_session_id,
       atr.id AS task_id, atr.started_at,
       EXTRACT(EPOCH FROM NOW() - atr.started_at)/3600 AS heures_ecoulees
FROM agencecom.agents a
JOIN agencecom.agent_task_runs atr
  ON a.id = atr.agent_id
WHERE atr.status = 'in_progress'
  AND atr.started_at < NOW() - INTERVAL '1 hour'
  AND atr.completed_at IS NULL
  AND a.status = 'busy';
```

**Action recommandée :** Libérer de force l’agent et clore la tâche avec un message d’erreur « Zombie détecté ».  
*Exemple de libération (après vérification)* :
```sql
UPDATE agencecom.agents
SET status = 'idle',
    last_released_at = NOW()
WHERE id IN (<liste_ids_zombies>);

UPDATE agencecom.agent_task_runs
SET status = 'error',
    completed_at = NOW(),
    error_message = 'Zombie task – killed by monitoring'
WHERE id IN (<liste_task_ids_zombies>);
```

### 2. Agents dont le taux d’erreur horaire dépasse le seuil (>5)
La colonne `error_count_last_hour` de la table `agents` est directement exploitable.

```sql
SELECT id, name, error_count_last_hour, total_errors, status
FROM agencecom.agents
WHERE error_count_last_hour > 5;
```

**Action recommandée :** Mettre en quarantaine temporaire les agents concernés (s’ils ne le sont pas déjà) et investiguer la cause (modèle, tâches, surcharge).  
*Mise en quarantaine* :
```sql
UPDATE agencecom.agents
SET status = 'quarantined',
    quarantined_until = NOW() + INTERVAL '15 minutes'
WHERE error_count_last_hour > 5
  AND status NOT IN ('quarantined');
```

### 3. Dérive de quarantaine (quarantined_until dépassé mais statut toujours `quarantined`)
Une quarantaine expirée (`quarantined_until < NOW()`) alors que l’agent est resté en statut `quarantined` traduit un drift : l’agent aurait dû être automatiquement libéré.

```sql
SELECT id, name, quarantined_until,
       EXTRACT(EPOCH FROM NOW() - quarantined_until)/3600 AS heures_depassement
FROM agencecom.agents
WHERE status = 'quarantined'
  AND quarantined_until IS NOT NULL
  AND quarantined_until < NOW();
```

**Action recommandée :** Libérer immédiatement ces agents et corriger le mécanisme de fin automatique de quarantaine.  
*Libération* :
```sql
UPDATE agencecom.agents
SET status = 'idle',
    quarantined_until = NULL,
    last_released_at = NOW()
WHERE status = 'quarantined'
  AND quarantined_until < NOW();
```

---

Ces trois requêtes couvrent les anomalies ciblées. Elles peuvent être planifiées (par exemple toutes les minutes) pour piloter une boucle de surveillance autonome, conformément aux leçons de monitoring événementiel (L-S199-CROSS-V52) et à la séparation santé/readiness (L453-HUB).