Cantieri aperti: differenze tra le versioni

[versione verificata][versione verificata]
WikiBot (discussione | contributi)
handoff automatico
WikiBot (discussione | contributi)
handoff automatico
Riga 8: Riga 8:
== Cantieri attivi ==
== Cantieri attivi ==
=== harness-standard ===
=== harness-standard ===
''Aggiornato 2026-08-12 09:11 UTC'' — dominio: architettura / knowledge base
''Aggiornato 2026-08-12 09:18 UTC'' — dominio: architettura / knowledge base


; Obiettivo : Sostituire il MASTER READ ORDER monolitico con un harness gerarchico e togliere Marco dal ruolo di loop di esecuzione
; Obiettivo : Sostituire il MASTER READ ORDER monolitico con un harness gerarchico e togliere Marco dal ruolo di loop di esecuzione
Riga 102: Riga 102:
* QWEN 3.8-MAX su v7.9: 5 e 5, mediana 5.0, IDENTICO a DeepSeek. Il confronto precedente Qwen 3/6 contro DeepSeek 4/6 era interamente rumore del giudice
* QWEN 3.8-MAX su v7.9: 5 e 5, mediana 5.0, IDENTICO a DeepSeek. Il confronto precedente Qwen 3/6 contro DeepSeek 4/6 era interamente rumore del giudice
* Il caso che fallisce sistematicamente e scelta_domanda: il modello descrive invece di scegliere ed eseguire
* Il caso che fallisce sistematicamente e scelta_domanda: il modello descrive invece di scegliere ed eseguire
* BATTITO E GUARDIANO costruiti su proposta di Marco. scripts/battito.py: una sessione scrive lo stato completo a intervalli, con il COMANDO ESATTO da eseguire dopo. scripts/guardiano_battito.py in cron ogni 2 minuti: se un battito non arriva da 5 minuti e il lavoro non e chiuso, esegue quel comando e avvisa su Telegram
* VARIANTE DI SICUREZZA rispetto alla proposta: il guardiano NON fa leggere il log a un modello che decide. Esegue solo il comando gia registrato dalla sessione. Nessun modello nel ciclo, quindi nessuna deriva e nessun comando inventato
* Altre sicurezze: massimo 6 ripartenze per lavoro, pausa 10 minuti fra due ripartenze, rispetto del cost guard OpenRouter, avviso Telegram a ogni ripresa
* PROVA END-TO-END SUPERATA: battito invecchiato di 9 minuti, guardiano ha rilevato la chat ferma, eseguito il comando, file /tmp/ripresa_ok.txt creato davvero, Telegram inviato
* La prima prova era fallita correttamente: cost guard TRIPPED, non e ripartito. La sicurezza ha funzionato prima ancora della funzione
* GUARD OPENROUTER era di nuovo TRIPPED da ieri sera 20:15 con spesa gia rientrata (1.243 su cap 3.00): riarmato, backup in .bak_20260812
; Provato ed escluso :
; Provato ed escluso :
* Adottare ahar / agentharnesses-cli: presuppone Claude Code su repo locale, Marco lavora da smartphone via route CC
* Adottare ahar / agentharnesses-cli: presuppone Claude Code su repo locale, Marco lavora da smartphone via route CC
Riga 132: Riga 138:
* Il giudice LLM come strumento di misura: varianza 3 punti su 6 sullo stesso input, inutilizzabile per un gate
* Il giudice LLM come strumento di misura: varianza 3 punti su 6 sullo stesso input, inutilizzabile per un gate
* Le tre conclusioni basate su di lui: v7.7 peggiorata (falso), Qwen inferiore a DeepSeek (falso), differenze fra versioni del Master (non dimostrate)
* Le tre conclusioni basate su di lui: v7.7 peggiorata (falso), Qwen inferiore a DeepSeek (falso), differenze fra versioni del Master (non dimostrate)
* Far decidere a un modello cosa eseguire alla ripresa: e la strada al loop infinito e al danno non sorvegliato. Il comando lo scrive la sessione quando e lucida, il guardiano lo esegue e basta
* Riarmo automatico del cost guard: resta manuale di proposito, ma la sentinella ora lo segnala
; Prossimo passo :
; Prossimo passo :
* Sostituire il giudice in gate_master.py e nella sentinella notturna con eval_det.py: la regola eval_pass in calo oggi darebbe falsi allarmi
* Aggiungere il battito al Master come passo dello STEP 5, con lindicazione di scrivere sempre il prossimo comando eseguibile
* Il caso scelta_domanda fallisce con tutti i modelli: e un difetto del Master, non del modello. La regola C sulla continuita va resa piu operativa
* Agganciare gate_master.py e la sentinella a eval_det.py al posto del giudice LLM
* Rendere piu operativa la regola C: scelta_domanda e lunico caso doro che fallisce con tutti i modelli
* Migrare i 289 script al gateway partendo dai 5 in cron
* Migrare i 289 script al gateway partendo dai 5 in cron