diese woche habe ich ein wenig im newton-policy-explorer verbracht und einfach durchgescrollt, was von anderen tatsächlich bereitgestellt wurde. ich habe nicht nach etwas Bestimmtem gesucht.
einen eintrag habe ich besonders im blick gehabt: Natural-Language-Policy. die beschreibung ist hinreichend klar; sie bewertet eine einfache englische regel anhand eines On-Chain-Ziels mithilfe eines llm statt handgeschriebener rego. keine dsl zum lernen, keine rego-syntax, die man richtig hinbekommen muss — beschreibe einfach die bedingung und lass das modell entscheiden.
das ergibt durchaus sinn.
zuerst habe ich mich darauf konzentriert, was die policy tatsächlich macht. der spannendere teil war dann, wie oft sie bereits bereitgestellt wurde.
Newtons Explorer paginiert auf Seite 1 von 49, insgesamt 290 Ergebnisse, und ein Teil dieser ersten Seite ist die gleiche Policy. Policy in natürlicher Sprache, gleicher Name, gleiche Beschreibung wortwörtlich, aber bei jeder Deploy-Instanz eine andere Adresse. Und das ist auch keine Namens-Sonderlichkeit: Hinter mindestens drei davon steht derselbe Ersteller.
Dieser Teil sitzt nicht richtig.

Was pro Instanz tatsächlich aufgezeichnet wird, ist nicht die Begründung des Modells. Es ist ein reines Verdict-only-Objekt: bestanden oder nicht bestanden. Nichts zeigt, wie es dahin gekommen ist. Rego kodiert in diesen Deployments keine Logik mehr – es reicht nur weiter, was auch immer das Modell entschieden hat.
Also wurde die Entscheidung woandershin verschoben.
Rego wird geschätzt, weil es deterministisch und statisch prüfbar ist: Man kann sich überlegen, was eine Policy zulässt und was nicht, bevor irgendetwas dagegen ausgeführt wird. Diese Entscheidung an ein LLM abzugeben nimmt diese Eigenschaft weg. Die Grenze wird weiterhin durchgesetzt, aber das Durchsetzen ist nichts mehr, was man von außen vollständig auditieren kann.
Also nimmt die Policy der Sache nicht die Entscheidung ab.
Es verschiebt es nur in das Modell.
Aber irgendetwas hat mich beim Durchgehen der Duplikate immer wieder genervt. 290 Deployments eines einzelnen experimentellen Musters, ohne sichtbare Abweichungen zwischen ihnen, ist kein offensichtlich belastbarer Beleg dafür, dass die Idee funktioniert. Genauso gut könnte es bedeuten, dass niemand testet, ob ein LLM-Verdikt als echte Sicherheitsgrenze taugt – sie kopieren einfach, was ohnehin schon existiert.
Wiederholung ist keine Validierung.
Der Accessibility-Fall hier ist zwar real. Rego zu schreiben heißt, eine Policiesprache zu lernen, mit der die meisten Solidity- oder Python-Entwickler noch nie zu tun hatten. Eine Bedingung in einfachem Englisch zu beschreiben und das Modell sie gegen eine Intention prüfen zu lassen, nimmt diese Hürde. Für Newtons Marketplace, der eher darauf ausgelegt ist, KI-Entwickler anzulocken als Rego-Spezialisten, ist das ein bewusstes Zugeständnis.
Diese Designentscheidung wird durchgezogen.

Der Teil, den ich noch nicht ganz geklärt habe, ist, ob 290 nahezu identische Deployments bedeuten, dass dieses Muster stillschweigend Newtons vertrauenswürdigen Standard wurde, um KI-gesteuerte Aktionen abzugrenzen – oder ob es nur heißt, dass ein Template 290-mal kopiert wurde, ohne dass jemand Stress-Tests gemacht hat, was passiert, wenn das Modell das Verdict falsch fällt.
Newton zeigt hier nicht, wie es gemacht wurde.
Keine Versionshistorie zwischen den Klonen, kein Hinweis darauf, dass sich eines von ihnen vom Original entfernt hat, um einen Edge Case abzudecken, nichts, was die Einsatzhistorie einer Deployment-Instanz von der anderen unterscheidet. Allein aus dem Explorer lässt sich nicht erkennen, ob getestet wurde, außer durch Kopieren.
Eine Natural-Language-Policy ist für Newton eine wirklich nützliche Grundbaustein-Form, wenn sie hält, was sie verspricht, so wie beschrieben. Die offene Frage ist, ob dreihundert Kopien das belegen – oder nur, dass es leicht ist, sie zu finden.
Bedeutet ein Muster, das so oft redeployt wird, dass es genug echten Einsatz überstanden hat, um vertrauenswürdig zu sein – oder macht das Verdict-only-Design einfach den Fehler so still, dass niemand es bemerkt, wenn es nicht funktioniert hätte?
@NewtonProtocol $NEWT #Newt $BILL $TRIA
