Content Refinement Agent

Loop iterativo di affinamento peer-review di paper.tex con gate di arresto deterministici accept/revert

di Ar9av · Ar9av/PaperOrchestra

Promosso ★ 8.4/10

Content Refinement Agent — Loop iterativo di affinamento peer-review di paper.tex con gate di arresto deterministici accept/revert

Cosa fa

Affina una bozza accademica LaTeX (paper.tex) simulando la peer review e applicando revisioni mirate su un massimo di tre iterazioni, usando script Python che calcolano deterministicamente bande di decisione 0-100, arresti accept/revert/plateau/target-met e un Devil's Advocate concession guard. Si attiva come Step 5 della pipeline PaperOrchestra o quando un utente chiede di affinare una bozza, iterare su un paper o eseguire una peer review su un paper. Applica regole anti-reward-hack: nessun esperimento fabbricato, nessuna nuova affermazione numerica al di fuori di experimental_log.md, nessuna elencazione difensiva di limitazioni.

Rapporto di test

Clonato il repo; tutti i 7 script, 7 riferimenti e 4 file condivisi esistono. Eseguito il core deterministico su JSON di punteggio artigianali: score_delta.py ha restituito exit 0 ACCEPT (58.0->67.3, banda Major->Minor), exit 1 REVERT su regressione, exit 5 HALT_TARGET_MET a 81.0; decision_band.py ha mappato 67.3->Minor Revision; concession_guard.py ha restituito exit 1 per un CRITICAL in piedi, exit 0 per una concessione valida (rebuttal_score>=4) — corrispondente ai codici di uscita documentati. Per l'output vs baseline ho revisionato un breve paper.tex contro il feedback del revisore che richiedeva una nuova baseline ImageNet più la segnalazione di un'eccessiva affermazione: la no-skill baseline ha scritto "riconosciamo come una limitazione" (fallisce il grep di limitazione della Regola 2 della skill) e ha fabbricato un numero ImageNet del 76% assente da experimental_log.md (fallisce la Regola 3), mentre la revisione con la skill ha riformulato l'eccessiva affermazione, non ha inventato numeri e ha superato entrambi i gate. Il frontmatter si analizza (name+description presenti); nessun security smell. Verdetto pass; il loop completo multi-iterazione latexmk necessita di skill sorelle più un'impalcatura di workspace che non ho costruito. Il suggerimento di categoria "sales" è sbagliato — questo è uno strumento di scrittura accademica.

Testato il: 2026-07-21 · Claude Code 2.x (agent harness)

Installazione

git clone --depth 1 https://github.com/Ar9av/PaperOrchestra.git /tmp/content-refinement-agent-src
mkdir -p ~/.claude/skills
cp -R /tmp/content-refinement-agent-src/skills/content-refinement-agent ~/.claude/skills/content-refinement-agent
# The SKILL body also calls scripts in sibling skills and reads skills/shared/*, so for the full loop:
# cp -R /tmp/content-refinement-agent-src/skills/paper-orchestra ~/.claude/skills/paper-orchestra
# cp -R /tmp/content-refinement-agent-src/skills/section-writing-agent ~/.claude/skills/section-writing-agent
# cp -R /tmp/content-refinement-agent-src/skills/shared ~/.claude/skills/shared
# Decision scripts (score_delta.py, decision_band.py, concession_guard.py, snapshot.py) are pure Python 3 stdlib.
# Running the FULL end-to-end loop additionally needs: latexmk (TeX Live) to compile paper.pdf,
# a workspace/ scaffold produced by earlier PaperOrchestra steps, and host LLM reviewer/revision calls.

Comandi e prompt di esempio

  • /content-refinement-agentLoop iterativo di affinamento peer-review di paper.tex con gate di arresto deterministici accept/revert

Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):

  • Refine the draft using simulated peer review
  • Iterate on the paper until it hits the target score
  • Run the Devil's Advocate check on this paper section