エージェント・ハーネスの再定義: AIエージェントを制御するハーネスの役割
LLM(大規模言語モデル)を自律的なAIエージェントとして動作させる際、モデル単体の力だけでは不十分です。モデルが自律的に推論し、ツールを呼び出し、環境に作用するためには、その周囲を取り囲むインフラストラクチャの構築が不 […]
Agents’ Last Exam (ALE): AIエージェントの合格率は1%未満
近年、AIはMMLUやSWE-benchなどのベンチマークを次々とクリアしていますが、実際の経済活動に直結する長期的な実務への導入はあまり進んでいません。この「実用性の課題」を測るため、実世界におけるワークフローの遂行能 […]
Retrospective Harness Optimization: ラベル不要のエージェント自己進化手法
AIエージェントが複雑なタスクを解決する際、ツールやプロンプト、スキル、ワークフローの集合体である「ハーネス(Harness)」の継続的な改善が欠かせません。しかし、既存の最適化手法には大きな課題があります。それは、最適 […]
Physics Is All You Need?~ AIエージェントは「答え」を最適化するが、「真理」は探究できない~
AI技術が飛躍的に進歩する中、「AIは科学研究のパートナーになれるのか?」と考える方も多いのではないでしょうか。しかし、科学的ソフトウェアの開発においては、単に「テストを通過する」ことではなく、「物理法則と一致しているか […]
SkillOpt: AIエージェントのスキルを最適化するための手法
最近、LLM(大規模言語モデル)を自律的なエージェントとして活用するケースが増えてきました。エージェントに特定のタスクを遂行させる際、自然言語で書かれた「スキル(指示書や手順書)」を与えるアプローチが一般的です。しかしな […]
Code as Agent Harness: AIエージェントを自律駆動させるためのアーキテクチャ
LLM(大規模言語モデル)の進化により、AIエージェントの開発が急速に進んでいます。しかし、複雑なタスクを長期間にわたって自律的に実行させるには、自然言語による指示だけでは限界があります。 現在、LLMにとって「コード」 […]
Ctx2Skill: 自律的なコンテキスト学習の実現
LLM(大規模言語モデル)に独自のドキュメントや複雑なデータを読み込ませ、特定のタスクを解かせたいと考えたことはありませんか? LLMが未知のコンテキスト(背景情報)からルールを読み取り、自ら推論を実施する能力は「コンテ […]
RecursiveMAS: 潜在空間の再帰による次世代マルチエージェント協調
現在、マルチエージェントシステム(MAS)において、エージェント間で「テキスト」を介して情報をやり取りする手法が一般的ですが、これが推論レイテンシ(遅延)を増大させる主な要因となっています。他のエージェントのテキスト出力 […]
Skills-Coach: LLMエージェントスキルの自動進化フレームワーク
LLMベースのエージェント開発において、「スキル」は特定のタスクを実行するための機能拡張モジュールとして広く利用されています。しかし、現状のスキルエコシステムには大きな課題があります。個々のスキルが局所的な問題解決に特化 […]
SWE-chat: 実際の開発者はAIコーディングエージェントをどう使っているのか?
AIコーディングエージェントが急速に普及していますが、実際の開発現場ではどのように使われているのでしょうか?この記事では、現実の利用実態を分析した初の大規模データセット「SWE-chat」から、実践的なインサイトを紹介し […]