AI AGENT HARNESS職種・部門別

開発部門のAgent Harness設計|Sandbox・レビュー・CIで変更を制御する

検索意図:開発 AIエージェント コーディング Sandbox CI CD セキュリティ 権限

結論

AIはIssue調査、変更案、コード・テスト下書きまで。専用SandboxとRepository単位の短命資格情報で動かし、テスト・セキュリティ検査・コードオーナー承認を通過した変更だけをCI/CDへ渡します。AIに本番の直接変更権限は与えません。

対象:CTO・開発責任者・プラットフォーム・SRE・セキュリティ・コードオーナー更新:2026-08-18次回確認:2026-09-18
Agent Harness内を探す

FIT / NO-FIT

先に、導入対象かを判定する

向いている条件

  • Issueと受入条件を記述できる
  • テスト・静的解析・セキュリティ検査を自動実行できる
  • 保護ブランチとコードオーナーがある
  • 本番変更を人が承認する

まだ導入しない条件

  • 本番環境へ直接アクセスさせる
  • 長期秘密情報をプロンプトや作業領域へ置く
  • テストなしのRepositoryで自動マージする
  • ライセンス・依存関係・変更履歴を追跡しない

DECISION CRITERIA

発注前に確認する判断基準

01実行境界

Repository、ブランチ、コマンド、ネットワークを用途別に制限できるか

進められる状態
専用Sandbox、Allowlist、短命資格情報、リソース上限がある
止めるサイン
開発者の端末・SSH鍵・クラウド管理者権限をそのまま渡す
02変更承認

AIの変更をテストと人のレビューなしで本番へ出さないか

進められる状態
必須テスト、セキュリティ検査、CODEOWNERS、保護ブランチ、デプロイ承認がある
止めるサイン
AIがmainへ直接pushし本番デプロイできる
03品質・停止

速度と再作業・事故を同じ変更単位で追えるか

進められる状態
待ち時間除外リードタイム、レビュー差戻し、テスト、脆弱性、ロールバックを測る
止めるサイン
生成行数やPR数だけで評価し、品質劣化を見ない

OPERATING FLOW

業務を完了するまでの役割分担

0101 / PLAN

Issueと変更範囲を確定

受入条件、対象Repository、禁止領域、実行可能コマンドを人が指定する。

責任:開発者・コードオーナー

0202 / BUILD

Sandboxで変更案を作成

短命資格情報を使い、分離環境でコード・テスト・説明を作る。

責任:開発エージェント

0303 / VERIFY

自動検査を実行

単体・結合テスト、静的解析、依存関係、秘密情報、脆弱性を確認する。

責任:CI・セキュリティ基盤

0404 / REVIEW & RELEASE

人がレビュー・リリース

コードオーナーが差分、設計、テスト、影響を確認し、CI/CDで段階的に反映する。

責任:コードオーナー・リリース責任者

REFERENCE ARCHITECTURE

Sandbox+検査ゲート+人の承認を持つ開発構成

01 / REQUEST

Issue / Repository Scope

受入条件、対象パス、禁止領域を機械可読にする。

02 / ORCHESTRATOR

Dev Agent Orchestrator

手順、コマンド、ネットワーク、回数、費用を制御する。

03 / SANDBOX

Ephemeral Workspace

短命資格情報と隔離ファイルシステムで変更案を作る。

04 / MODEL & TOOLS

Model / Repo / Test Tools

Allowlist内のRepository、依存取得、テストだけを許可する。

05 / GATES

Tests / SAST / Secret Scan

失敗時はマージせず、結果と修正差分を残す。

06 / REVIEW

Code Owner & CI/CD

人の承認後に保護ブランチと段階的デプロイへ進める。

07 / AUDIT

Prompt / Diff / Run Log

入力、ツール、差分、検査、承認、デプロイを追跡する。

横断制御

  • Repository・パスAllowlist
  • 短命資格情報
  • Sandbox
  • ネットワーク制限
  • 秘密情報検査
  • 必須テスト
  • CODEOWNERS承認
  • 本番直接変更禁止
  • ロールバック

エージェントはPull Request候補を作る実装者です。本番変更の決定者・実行責任者にはしません。

USE CASES

最初に検証する3業務

01

Issue分析と実装計画

入力
Issue、受入条件、対象コード・設計文書
Agentの処理
影響箇所、リスク、変更・テスト案を整理
成果物
根拠リンクつき実装計画
人が決める範囲
要件解釈、設計採否、変更範囲は開発者が確定

最初のKPI:調査時間、計画修正率、対象外変更件数

02

コード・テスト下書き

入力
承認済み計画とRepository範囲
Agentの処理
Sandboxで差分とテストを作成
成果物
Pull Request候補と検査結果
人が決める範囲
コードオーナーがレビューし、AIは自動マージしない

最初のKPI:待ち時間除外リードタイム、レビュー差戻し、テスト合格率

03

障害調査支援

入力
マスキング済みログ、メトリクス、変更履歴
Agentの処理
時系列、相関、確認手順、暫定案を整理
成果物
根拠つき調査メモ
人が決める範囲
本番操作、原因確定、復旧判断は当番責任者が実施

最初のKPI:調査時間、誤仮説率、無権限操作件数

ROI / TCO

効果と費用を同じ前提で比べる

レビュー・検査・再作業を含む純便益

月間対象変更数 ×(現在の実作業時間 − AI利用後の実作業・レビュー・修正時間)× 時間単価 −(実行基盤費+検査・運用費+ロールバック費)

  • キュー待ちを除いた調査・実装・テスト時間を変更種別ごとに測る
  • コードレビュー、セキュリティ確認、修正時間を残す
  • 障害対応、ロールバック、依存更新の追加負荷を便益から差し引く
  • 生成行数や一般的な開発速度の市場値を使わない

検討例:低リスクのIssue10〜30件で、確認込み時間、差戻し、テスト、脆弱性、ロールバックを比較し、品質基準を満たす変更種別だけ拡張する。

BlueAI試算モデルです。開発速度、品質、障害削減を保証せず、自社Repositoryの変更種別・検査・運用実績で更新します。

Repository・言語

依存関係と環境差分が多いほど上がる

Repository数、モノレポ、言語、ビルド・テスト環境。

Sandbox・権限

クラウド・内部サービス接続と隔離要件で上がる

分離環境、短命資格情報、ネットワーク、データ準備。

品質ゲート

必須検査と段階的リリースが増えるほど変動する

テスト、SAST、秘密情報、依存、ライセンス、承認。

STOP CONDITIONS

失敗を小さく止める条件

01

秘密情報の露出

兆候:プロンプト、ログ、差分、外部通信に鍵・トークン・顧客情報が現れる

対応:実行を即時停止し、資格情報を失効・再発行して影響範囲を調査する

02

本番への直接変更

兆候:AIが保護ブランチ、CI/CD承認、本番環境を迂回できる

対応:当該資格情報と経路を無効化し、人の承認ゲートを復旧するまで運用を停止する

03

検査不合格・追跡不能

兆候:必須テストやセキュリティ検査の失敗、出所不明コード、実行ログ欠落がある

対応:マージ・リリースを禁止し、差分を破棄または人手レビューへ戻す

90-DAY ROADMAP

90日で本番判断まで進める

0〜30日

対象変更と実行境界を定義

  • 低リスクIssueと現在時間を測定
  • Repository・パス・コマンド・ネットワークをAllowlist化
  • 短命資格情報、必須検査、コードオーナーを設定

判定:開発・セキュリティ・運用責任者が本番直接変更禁止と停止条件を承認する

31〜60日

SandboxでPR候補を評価

  • 隔離環境で計画・コード・テストを作成
  • 全変更で自動検査と人のレビューを実施
  • 差戻し、脆弱性、秘密情報、対象外変更を記録

判定:秘密情報露出・本番操作0件で、必須検査と追跡性の基準を満たす

61〜90日

限定Repositoryで運用

  • 対象チーム・変更種別を限定
  • PR作成までをエージェント化
  • 週次で品質、費用、権限、ロールバックを確認

判定:停止条件に抵触せず、コードオーナーとCI/CDの統制を維持できる

SOURCES / METHOD

根拠・確認範囲・更新日

BlueAI実務フレーム

株式会社BlueAI

BlueAI Agent Harness 開発設計フレーム v1.0

適用範囲:Sandbox、短命資格情報、Repository境界、検査ゲート、人の承認、秘密情報・本番変更停止条件の設計。

提供状態:業務・権限・事故条件のレビューに応じて月次確認

確認日
2026-08-18
BlueAI試算

株式会社BlueAI

BlueAI Agent Harness ROI試算モデル

適用範囲:現在工数、確認後工数、運用工数から純便益を整理するモデル。市場平均や成果保証ではない。

提供状態:入力前提と実績差分を案件ごとに確認

確認日
2026-08-18
執筆:株式会社BlueAI技術レビュー:BlueAI 技術レビュー次回確認:2026-09-18

RELATED GUIDES

01 基礎・比較

AGENT HARNESS / FOUNDATION

Agent Harnessのセキュリティ

Agent Harnessのsecurityは、モデルを信用して権限を渡す設計ではなく、入力を未信頼として扱い、専用ID・最小権限・tool policy・人の承認・完全な証跡・即時停止を実行基盤側で強制します。

BlueAI実務フレームBlueAI試算
更新 2026-08-18
技術レビュー:BlueAI 技術レビュー
設計条件を見る →
02 企業規模別

AGENT HARNESS / COMPANY SIZE

500名以上:全社統制と委譲

中央基盤はポリシー、ID、モデル、監査、停止を所有し、各組織へ業務設計と日常運用を委譲します。開発・検証・本番を分け、変更と例外を証跡化します。

BlueAI実務フレームBlueAI試算
更新 2026-08-18
技術レビュー:BlueAI 技術レビュー
設計条件を見る →
03 基礎・比較

AGENT HARNESS / FOUNDATION

Agent Harness基盤比較

製品名ではなく、必要なsurfaceと自社が所有する範囲で選びます。DeepSeek Harnessは公式OSSですがDeveloper Previewかつprereleaseで、安定した本番標準基盤とは断定できません。LangGraphは低レベルorchestration、OpenAI Agents SDKはagent primitiveを組むSDKとして評価します。

BlueAI実務フレームBlueAI試算
更新 2026-08-18
技術レビュー:BlueAI 技術レビュー
設計条件を見る →

FROM GUIDE TO DECISION

自社の業務・費用・承認条件に置き換える。

一般情報は登録なしで確認できます。次に、AI利益MAPで投資回収を試算し、RFPで権限・評価・停止条件を発注文書へ落とします。