Cantieri aperti: differenze tra le versioni
| [versione verificata] | [versione verificata] |
handoff automatico |
handoff automatico |
||
| Riga 8: | Riga 8: | ||
== Cantieri attivi == | == Cantieri attivi == | ||
=== harness-standard === | === harness-standard === | ||
''Aggiornato 2026-08-12 | ''Aggiornato 2026-08-12 09:11 UTC'' — dominio: architettura / knowledge base | ||
; Obiettivo : Sostituire il MASTER READ ORDER monolitico con un harness gerarchico e togliere Marco dal ruolo di loop di esecuzione | ; Obiettivo : Sostituire il MASTER READ ORDER monolitico con un harness gerarchico e togliere Marco dal ruolo di loop di esecuzione | ||
| Riga 97: | Riga 97: | ||
* Questo invalida retroattivamente due conclusioni: la v7.7 non era necessariamente peggiorata (5 a 4 era rumore) e il confronto Qwen 3/6 contro DeepSeek 4/6 non e significativo | * Questo invalida retroattivamente due conclusioni: la v7.7 non era necessariamente peggiorata (5 a 4 era rumore) e il confronto Qwen 3/6 contro DeepSeek 4/6 non e significativo | ||
* La sentinella notturna ha una regola su eval_pass in calo: con questa varianza produrra falsi allarmi | * La sentinella notturna ha una regola su eval_pass in calo: con questa varianza produrra falsi allarmi | ||
* GIUDICE STABILIZZATO: creato scripts/eval_det.py con criteri deterministici per parole chiave al posto del giudice LLM. Ogni caso doro ha un elenco DEVE e un elenco NON DEVE verificabili: shot.py presente, /vm/task assente, sql e non query, handoff.py con --list e --resume, scelgo/procedo senza chiedere a Marco. Costo del giudizio: zero | |||
* VARIANZA AZZERATA: v7.9 misurata 5 e 5, dove il giudice LLM sullo stesso documento dava 5, 2, 4 | |||
* RIMISURATO TUTTO con il metro stabile: v7.6 mediana 5.5, v7.7 mediana 5.5, v7.9 mediana 5.0. Le differenze restano dentro 1 punto: nessuna delle versioni si distingue davvero dalle altre | |||
* QWEN 3.8-MAX su v7.9: 5 e 5, mediana 5.0, IDENTICO a DeepSeek. Il confronto precedente Qwen 3/6 contro DeepSeek 4/6 era interamente rumore del giudice | |||
* Il caso che fallisce sistematicamente e scelta_domanda: il modello descrive invece di scegliere ed eseguire | |||
; Provato ed escluso : | ; Provato ed escluso : | ||
* Adottare ahar / agentharnesses-cli: presuppone Claude Code su repo locale, Marco lavora da smartphone via route CC | * Adottare ahar / agentharnesses-cli: presuppone Claude Code su repo locale, Marco lavora da smartphone via route CC | ||
| Riga 125: | Riga 130: | ||
* Pubblicare una versione del Master senza misurarla: e il difetto che larticolo Harness-R1 documenta, i modelli fissi propongono patch plausibili che peggiorano | * Pubblicare una versione del Master senza misurarla: e il difetto che larticolo Harness-R1 documenta, i modelli fissi propongono patch plausibili che peggiorano | ||
* Fidarsi di una singola esecuzione delleval: serve la mediana su piu run, e anche cosi oggi non basta | * Fidarsi di una singola esecuzione delleval: serve la mediana su piu run, e anche cosi oggi non basta | ||
* Il giudice LLM come strumento di misura: varianza 3 punti su 6 sullo stesso input, inutilizzabile per un gate | |||
* Le tre conclusioni basate su di lui: v7.7 peggiorata (falso), Qwen inferiore a DeepSeek (falso), differenze fra versioni del Master (non dimostrate) | |||
; Prossimo passo : | ; Prossimo passo : | ||
* | * Sostituire il giudice in gate_master.py e nella sentinella notturna con eval_det.py: la regola eval_pass in calo oggi darebbe falsi allarmi | ||
* Il caso scelta_domanda fallisce con tutti i modelli: e un difetto del Master, non del modello. La regola C sulla continuita va resa piu operativa | |||
* Migrare i 289 script al gateway partendo dai 5 in cron | * Migrare i 289 script al gateway partendo dai 5 in cron | ||