Product School · Advanced AI Agents

A multi-agent NDA review system with a built-in safety checkUn sistema multi-agente de revisión de NDAs con un chequeo de seguridad integrado

A three-agent NDA review chain (Extractor → Analyzer → Critic) built in Langflow, designed so the binding constraint is Legal's trust, not BizDev's appetite for speed.Una cadena de tres agentes para revisar NDAs (Extractor → Analyzer → Critic) construida en Langflow, diseñada para que la restricción sea la confianza de Legal, no las ganas de velocidad de BizDev.

RoleRol
Product Lead · cohort contributorProduct Lead · contribuidora de cohorte
YearAño
2026
MethodsMétodos
Multi-agent · agent specs · governanceMulti-agente · specs de agentes · gobernanza
CourseCurso
Product School · Advanced AI Agents
AI BuilderAI BuilderLangflowMulti-agentGovernanceGobernanza

The problemEl problema

In the course scenario, a BizDev team waits 10 to 14 days for Legal to do a first-pass read on inbound NDAs, and deals stall in the queue. The product question was whether an agent could give BizDev a trustworthy first read in under an hour without becoming a faster, riskier version of manual review. The hard part was not speed. It was making the output defensible enough that a General Counsel would sign off on it.En el escenario del curso, un equipo de BizDev espera de 10 a 14 días a que Legal haga una primera lectura de los NDAs entrantes, y los deals se atoran en la fila. La pregunta de producto era si un agente podía dar a BizDev una primera lectura confiable en menos de una hora sin volverse una versión más rápida y más riesgosa de la revisión manual. Lo difícil no era la velocidad. Era que el resultado fuera lo bastante defendible como para que un General Counsel lo firmara.

The team, and my part in itEl equipo, y mi parte en él

This was the capstone for the Advanced AI Agents course (Modules 1 to 6), done by a six-person cohort group: Agnes Kovacs, Brenda Plinck, David Szarvas, Hannah Sun, Renata Bardos, and Saraí Díaz. We took the NDA Helper from a single-agent concept to a working multi-agent prototype, two written specs, and a final deliverable deck. As Product Lead I focused on the product framing, the pattern selection, and the governance gates, and contributed to the hands-on agent building in Langflow. The credit here is shared.Este fue el proyecto final del curso Advanced AI Agents (Módulos 1 a 6), hecho por un grupo de cohorte de seis personas: Agnes Kovacs, Brenda Plinck, David Szarvas, Hannah Sun, Renata Bardos y Saraí Díaz. Llevamos el NDA Helper de un concepto de un solo agente a un prototipo multi-agente funcional, dos specs escritas y un deck de entrega final. Como Product Lead me enfoqué en el encuadre de producto, la selección de patrón y las compuertas de gobernanza, y contribuí a la construcción de los agentes en Langflow. El crédito aquí es compartido.

Choosing the architecture against the real constraintElegir la arquitectura contra la restricción real

We evaluated three patterns: a single ReAct agent, a Planner plus Executor, and a Critic-Executor Loop. We chose the Critic-Executor Loop because the binding constraint was Legal's trust. The explicit Critic role is the artifact you point at when a General Counsel pushes back. The whole design decision followed from asking what would make a legal stakeholder comfortable, not from what would be fastest to build.Evaluamos tres patrones: un solo agente ReAct, un Planner más Executor, y un Critic-Executor Loop. Elegimos el Critic-Executor Loop porque la restricción era la confianza de Legal. El rol explícito del Critic es el artefacto que señalas cuando un General Counsel objeta. Toda la decisión de diseño salió de preguntar qué dejaría cómodo a un stakeholder legal, no de qué sería más rápido de construir.

The specs and the prototypeLas specs y el prototipo

The fix that made the chain reliableEl arreglo que hizo confiable la cadena

The biggest debugging win was constraining each agent to a single JSON schema (clause_map, draft_payload, verdict) so the handoffs stayed clean, and telling the Critic in plain terms: never rewrite or draft the answer, verdict and reasons only. Before that rule the Critic kept producing improved drafts and bypassed the Analyzer entirely. The Critic-as-pure-validator and the Orchestrator-owned retry counter are what stopped the chain from looping on stubborn cases.El mayor avance al depurar fue restringir cada agente a un solo esquema JSON (clause_map, draft_payload, verdict) para que los handoffs quedaran limpios, y decirle al Critic sin rodeos: nunca reescribas ni redactes la respuesta, solo veredicto y razones. Antes de esa regla el Critic seguía produciendo borradores mejorados y se saltaba al Analyzer por completo. El Critic como validador puro y el contador de reintentos en manos del Orquestador son lo que evitó que la cadena se ciclara en casos tercos.

Governance and rolloutGobernanza y despliegue

Hard-escalation categories (IP assignment, indemnification caps, non-US jurisdiction, perpetual term) bypass the Critic and auto-route to Legal. Clause-level audit logging supports spot-checks. The rollout plan stages toward L2 autonomy on a narrow subset only: standard, US-jurisdiction, mutual NDAs with Critic confidence at or above 0.9 and zero flags. Everything outside that subset stays with a human.Las categorías de escalamiento duro (cesión de IP, topes de indemnización, jurisdicción fuera de EE. UU., plazo perpetuo) se saltan al Critic y se enrutan automáticamente a Legal. El registro de auditoría a nivel cláusula habilita revisiones puntuales. El plan de despliegue avanza hacia autonomía L2 solo en un subconjunto estrecho: NDAs estándar, de jurisdicción de EE. UU., mutuos, con confianza del Critic de 0.9 o más y cero banderas. Todo lo que quede fuera de ese subconjunto se queda con un humano.

Metrics as design targetsMétricas como objetivos de diseño

These are the bars the system was designed to clear, not numbers it has hit. The recommended success metric is flag precision and recall against a Legal baseline: the goal was to flag at least 95% of the clauses Legal would flag with 5% or fewer false alarms, measured against a labeled set of 100 historical NDAs. Supporting design targets: time-to-first-decision modeled from about 14 days down to under one hour, and 60 to 70% of standard NDAs auto-resolved without escalation. All of these are targets from the course scenario, not measured production results.Estos son los listones que el sistema fue diseñado para librar, no números que haya alcanzado. La métrica de éxito recomendada es precisión y recall de las banderas contra una línea base de Legal: la meta era marcar al menos 95% de las cláusulas que Legal marcaría con 5% o menos de falsas alarmas, medido contra un conjunto etiquetado de 100 NDAs históricos. Objetivos de diseño de apoyo: tiempo a la primera decisión modelado de unos 14 días a menos de una hora, y 60 a 70% de los NDAs estándar auto-resueltos sin escalamiento. Todos son objetivos del escenario del curso, no resultados medidos en producción.

What we deliveredQué entregamos

A working Langflow prototype, two complete specs (AWSpec and MACSpec), and a final deliverable deck. The transferable result is a defensible design: an explicit validator role and an Orchestrator-owned retry counter that together made the output something a legal stakeholder could sign off on.Un prototipo funcional en Langflow, dos specs completas (AWSpec y MACSpec), y un deck de entrega final. El resultado transferible es un diseño defendible: un rol validador explícito y un contador de reintentos en manos del Orquestador que juntos hicieron del resultado algo que un stakeholder legal podría firmar.

Team project for a Product School cohort; Brenda contributed as Product Lead. All names, framing, and metrics belong to the course case scenario, and the figures above are design targets from that scenario, not measured production results.Proyecto de equipo de una cohorte de Product School; Brenda contribuyó como Product Lead. Todos los nombres, el encuadre y las métricas pertenecen al escenario del curso, y las cifras de arriba son objetivos de diseño de ese escenario, no resultados medidos en producción.

© 2026 Brenda Plinck · Libreta Studio · Dallas / CDMX