Skip to content

エージェント・自動化

ツールを使う AI システムと自律ワークフロー — 実際に何を自動化するのか。

14 本

AWSがBedrock AgentCore上でインタラクティブなMCPアプリを構築する方法を解説

AWSによると、同社のAmazon Bedrock AgentCoreプラットフォームは、ChatGPTやClaudeといったAIホスト内でインタラクティブなHTMLウィジェットを描画するModel Context Protocolの拡張機能「MCP Apps」に対応している。AWSは「Unicorn Rentals」というサンプルアプリでこの機能を実演し、AgentCoreのランタイムとゲートウェイを通じてレンタル品の閲覧、予約、確認、返却ができることを示した。

約3分

AWSが説明する、AgentCore Evaluationsと DevOpsエージェントによる本番稼働中AIエージェントの監視手法

AWSは、AgentCore EvaluationsとAWS DevOps Agentが連携して本番環境のAIエージェントを監視する仕組みを解説するブログ記事を公開した。AWSによると、AgentCore Evaluationsは稼働中のエージェントのやり取りを品質面で評価し、DevOps Agentはサービス境界をまたいだインフラ障害を追跡するという。AWSはこのアプローチを、4つのエージェントで構成される航空会社予約システムを用いて実演した。

約3分

Skild AI、NVIDIAのPhysical AIスタックで訓練したロボットモデル「S1」を発表

Skild AI launched S1, a robot foundation model that learns new, multistep tasks from a single video demonstration without retraining. Built on NVIDIA's Isaac Lab, Cosmos, Omniverse and TensorRT technologies, Skild says S1 succeeded at 66% of steps on new tasks versus 9% for a comparable system, and the company has reached a $100 million annual revenue run rate.

約4分

ミストラル、AIエージェントによるFortranコード4万行の移行事例を公開

ミストラルは、欧州のエネルギー事業者との共同プロジェクトについて説明し、物理演算主体の貯留層シミュレーターのFortran 77コード4万行をC++に移行したと明らかにした。同社は数値パリティ検証の仕組みを構築し、コードベースの文書化にエージェントを活用したほか、最終的にはコーディング担当、テスト担当、レビュー担当のエージェントを組み合わせ、人間によるチェックポイントを設けたワークフローを採用したという。

約3分

AWS、Bedrock AgentCore上に構築したHeurist Financeの投資ワークベンチの詳細を公表

AWSは、Heurist FinanceがAmazon Bedrock AgentCore上にAI搭載の投資ワークベンチを構築した経緯を紹介する事例報告を公開した。AWSによると、このシステムは市場データやオルタナティブデータ、提出書類、ニュース、ポートフォリオ構築、シナリオ分析、ポジション監視をチャット形式の体験に統合し、AgentCoreの各サービスが認証、メモリ、コード実行、決済、可観測性を担う。

約3分

Databricks、Zeptoの評価優先型カスタマーサポートエージェントの詳細を公開

Databricksによると、ZeptoはDatabricksとMLflowを使い、カスタマーサポートエージェント向けの二重ループ評価フレームワークを構築した。このシステムは、開発時のテスト、本番環境の監視、実行トレース、ゴールデンデータセット、デプロイ時の品質ゲートを組み合わせている。Databricksによれば、これらのエージェントは人間の監督下でサポートチケットの80%超を完全に処理している。

約3分

AWS、Bedrock AgentCoreで構築したマルチモーダル対応のWhatsApp注文アシスタントの詳細を公開

AWSは、Amazon Bedrock AgentCoreとAmazon Nova 2モデルを活用し、WhatsApp上で飲食店向け注文アシスタントを導入するための技術ガイドを公開した。この設計では、1つのビジネス用電話番号でテキストメッセージ、音声メモ、通話に対応し、チャネル間で共有されるメモリと、メニュー、カート、注文、店舗情報を一元管理する共通バックエンドを利用する。

約3分

エージェントのコンテキストウィンドウは日記ではなく予算だ——Anthropicはこう使っている

Anthropicの指針は、プロンプトエンジニアリングをコンテキストエンジニアリングとして捉え直す。すべてを蓄積するのではなく、各ターンで価値の高い最小限のトークン群を選別するという考え方だ。同社独自の評価では、古くなったツール実行結果の自動消去と外部メモリファイルを組み合わせることで、検索タスクの成績が39%向上し、100ターンにわたるトークン使用量が84%削減された。

約4分

Anthropic公式ガイドが示す、Claude Skillを実際に機能させる条件

Skillの成否を左右するのは、ただ一つのフィールドだ。三人称で記述し、何をするSkillなのか、いつ使うのかを明記したdescriptionである。SKILL.mdは500行未満、参照ファイルは1階層までに抑え、使用予定のすべてのモデルでテストすること。そして、信頼できない提供元のSkillは決してインストールしてはならない。

約4分

KaggleのセルフペースコースでAIエージェント構築を実践する

AIエージェントの構築に関心がある開発者は、GoogleとKaggleの5日間コースを自分のペースで進めるプログラムとして活用できる。コードラボや技術ホワイトペーパー、ノートブックに取り組み、エージェント設計、セキュリティ、クラウド展開を網羅する集大成プロジェクトを構築するとよい。デバッグの助けやスタディグループにはKaggleのDiscordを利用する。

更新 約4分

Anthropic、アレン研究所およびHHMIと科学研究向けAIシステムで提携

Anthropicは、アレン研究所およびハワード・ヒューズ医学研究所(HHMI)とのライフサイエンス分野における提携を発表した。HHMIはAnthropicと共同で専門的な実験室向けエージェントの開発に取り組み、アレン研究所は科学的分析や実験設計をはじめとする研究業務のための、連携動作するマルチエージェントシステムの開発で協力する。両提携は、Claudeの生命科学分野における能力の拡充にも活用される見込みである。

約3分

分析: OpenAIはハーネスを開源したのではなく、モデルを開源したのではなく、そしてそれが戦略である

ハーネスはモデルを取り巻くコードです:コンテキストを組み立て、ツール呼び出しループを実行し、イベントをストリーミングし、長いセッションをコンパクトにし、不可逆なアクションを人間の承認の下で保持します。OpenAIはCodexのハーネス — codex exec, the app-server and the SDK — をApache-2.0の下でリリースしたので、どの企業でも自社のソフトウェアに同じエージェントループを組み込むことができ、その背後にあるモデルの料金を支払い続けることができます。

約7分

AI エージェントとは何か — チャットボットと何が違うのか

AI エージェントとは、呼び出せるツールと追うべき目標を与えられ、各ステップで人間に尋ねずに複数の手順を進める権限を持った言語モデルである。チャットボットは質問に答えて止まるが、エージェントは目標が達成されたと判断するか、予算を使い切るまで行動し続ける。

約5分

分析:AI エージェントがデモから本番へ移るとき、実際に何が変わったのか

デモは短い正常系を人が見ている前で一度だけ回す。本番は監視なしで何千もの変種を回し、そこでは各ステップの誤り率が掛け算され、広すぎる権限が一つの誤判断を事故に変える。うまくいく導入は範囲を狭め、各ステップを安く検証し、不可逆な行為ごとに門を置く。

約4分