AI-orkestrering · hvornår en agent må handle selv

En agent skal vide hvornår den ikke ved nok — før den handler, ikke bagefter.

Når I sætter AI-agenter i produktion, er det svære ikke at koble dem sammen — det gør rammeværktøjerne (LangGraph, CrewAI, AutoGen). Det svære er at vide, skridt for skridt, hvornår et svar er for usikkert til at stole på. Det måler vi: friktion = konkurrerende ruter pr. beslutning — aflæst gratis af modellens eget output. Lav friktion → kør autonomt. Høj friktion → stop, hent mere, eller ræk opgaven til et menneske.

Én knude i grafen: mål → gate → commit / hent / menneske
1 · KALD model / værktøj med logprobs 2 · FRIKTIONSMÅLER konkurrerende ruter + entropi → usikkerhed pr. skridt · gratis 3 · GATE vs. tærskel LAV FRIKTION Commit — kør autonomt videre MELLEM Extend · hent (RAG) · afstå HØJ / OOD Menneske i loopet · eskalér hvert kald → revisérbart usikkerheds-spor ÉN POLITIK · TRE UDFALD

Hvad gaten giver jer

  • Usikker hallucination fanges før den spredes. Et skridt hvor friktionen stiger, flagges på stedet i stedet for at forplante sig gennem resten af agent-kæden.
  • Autonomi gated på målt usikkerhed. Modellen handler selv, når den er sikker, og holder igen, når den ikke er — I sætter tærsklen, ikke modellens humør.
  • Et revisérbart spor pr. beslutning. Hvert kald bærer sit eget usikkerhedstal, så en agent-handling kan dokumenteres og efterprøves bagefter.
  • Næsten gratis. Signalet genbruger data kaldet allerede returnerer — ingen ekstra dommer-model i den kritiske sti.

Hvad det erstatter

  • En ekstra dommer-model i hvert skridt — dyr, langsom og med sin egen usikkerhed oven i den I prøvede at måle.
  • Regel-stakke der kollapser lydigheden. Vores egen forskning måler det: da et regelsæt gik fra 1 til 10 konkurrerende krav, faldt overholdelsen ~90 % → ~36 %. Derfor gater vi på ét målt signal frem for at stable regler.
  • Binære valg — "kør altid autonomt" (usikkert) eller "eskalér altid alt" (så er der ingen automatisering tilbage). Gaten giver mellemvejen: gradueret efter usikkerhed.

Gate hårdt når

skridtet er svært at fortryde — en transaktion, en udadgående besked, en sletning — eller påstanden kan tjekkes mod en kilde. Her verificerer vi uafhængigt, uanset friktion. Det er dette lag der fanger confident-wrong: et flydende, lav-friktions-svar der bare er forkert — friktionen flagger det ikke, indsatsen gør. Her gater vi på konsekvens og målt anfægtelighed — aldrig på modellens egen selvsikkerhed. Se arkitekturen →

Gate blødt når

skridtet er billigt og reversibelt og base-tilliden er høj. Lad modellen køre selv, og brug sporet til at fange de få tilfælde, hvor friktionen alligevel stiger.

“Vi måler modellens egen usikkerhed på hvert skridt og lader den handle selv, når den er sikker, hente mere, når den ikke er, og række opgaven til et menneske, når den er på gyngende grund — og hvert skridt kan I måle og revidere.”

1Mål friktion: konkurrerende ruter, gratis fra modellens output.
2Kalibrér tærsklen: per model × opgave, mod jeres egne data.
3Gate: commit · hent · menneske — med et spor på hvert kald.