SkillOpt: AIエージェントのスキルを最適化するための手法

最近、LLM(大規模言語モデル)を自律的なエージェントとして活用するケースが増えてきました。エージェントに特定のタスクを遂行させる際、自然言語で書かれた「スキル(指示書や手順書)」を与えるアプローチが一般的です。しかしな […]

LLMの量子化がもたらす「アライメントの崩壊」

LLM(大規模言語モデル)をクラウドやエッジ環境で実運用する際、推論コストやメモリ使用量を削減するための「量子化」は欠かせない技術です。しかし、実社会のハイステークスな領域への適用が進むにつれ、量子化がハルシネーションや […]

Code as Agent Harness: AIエージェントを自律駆動させるためのアーキテクチャ

LLM(大規模言語モデル)の進化により、AIエージェントの開発が急速に進んでいます。しかし、複雑なタスクを長期間にわたって自律的に実行させるには、自然言語による指示だけでは限界があります。 現在、LLMにとって「コード」 […]

MinT: LLMを効率的に管理する次世代インフラ

近年、LLM(大規模言語モデル)の運用において、タスクやユーザーごとにモデルを微調整してデプロイする機会が増加しています。しかし、細分化されたバリアントごとにフルサイズのチェックポイントをコピーしたり移動させたりする従来 […]

AstroAlertBench: マルチモーダルLLMによる天体分類の現在地

現在の天文学の最前線では、ZTF (Zwicky Transient Facility) などの大規模な観測プロジェクトによって、毎晩数百万件もの天文アラート(突発天体などの観測通知)が生成されています。しかし、データ量 […]

Ctx2Skill: 自律的なコンテキスト学習の実現

LLM(大規模言語モデル)に独自のドキュメントや複雑なデータを読み込ませ、特定のタスクを解かせたいと考えたことはありませんか? LLMが未知のコンテキスト(背景情報)からルールを読み取り、自ら推論を実施する能力は「コンテ […]

RecursiveMAS: 潜在空間の再帰による次世代マルチエージェント協調

現在、マルチエージェントシステム(MAS)において、エージェント間で「テキスト」を介して情報をやり取りする手法が一般的ですが、これが推論レイテンシ(遅延)を増大させる主な要因となっています。他のエージェントのテキスト出力 […]

Skills-Coach: LLMエージェントスキルの自動進化フレームワーク

LLMベースのエージェント開発において、「スキル」は特定のタスクを実行するための機能拡張モジュールとして広く利用されています。しかし、現状のスキルエコシステムには大きな課題があります。個々のスキルが局所的な問題解決に特化 […]

SWE-chat: 実際の開発者はAIコーディングエージェントをどう使っているのか?

AIコーディングエージェントが急速に普及していますが、実際の開発現場ではどのように使われているのでしょうか?この記事では、現実の利用実態を分析した初の大規模データセット「SWE-chat」から、実践的なインサイトを紹介し […]

Tool-Overuse: なぜLLMは内部知識よりも外部ツールを好むのか?

最近、LLMを利用したシステムを開発する中で、「内部知識で答えられるはずの簡単な質問なのに、なぜか外部APIを叩いてレスポンスが遅くなっている」と感じたことはないでしょうか? LLMが外部ツールを呼び出して問題を解決する […]