Mingbird 是一个面向 Windows 和 Ollama 的本地优先智能体框架,旨在帮助小型开源权重模型(2-9B)完成实际任务,解决上下文溢出和循环等常见失败模式。它采用了十种机制,包括字节级净零预填充预算和签名级循环检测,以弥补这些问题。

  • 在 LRAB 基准测试中,Mingbird 取得了 0.886 的整体得分,优于 goose(0.631)、opencode(0.479)和 agent-mini(0.405)。
  • 在 τ²-bench 评估中,其总分为 0.856,而其他框架分别为 0.791 和 0.737。
  • 该系统包含一个完成门控机制,在接受完成前会重新读取任务,以防止偏离目标。

作者认为,小型模型的大量失败可归因于框架而非模型本身,证明了 Mingbird 的方法显著提升了可靠性。