Random Attention: KVキャッシュ削除により推論を加速させる
DeepSeek-R1 や Qwen3、Phi-4-reasoning といった推論特化型の大規模言語モデルは、難しい問題を解くために数万トークンにおよぶ思考連鎖(Chain of Thought: 思考の途中経過をテキ […]
AIエージェントの信頼性を決定づけるハーネス設計の最前線
LLMエージェントを本番環境で運用し始めると、多くの開発者が共通の課題に直面します。温度パラメータ(temperature)を下げて同一の入力を与えた場合でも、実行ごとにツールの呼び出し順序や最終出力が微妙に変動してしま […]
LLMERS: LLM強化型レコメンデーションシステムの全体像
大規模言語モデル(Large Language Model: LLM)に推薦結果を直接生成させると、1回の応答に数秒かかります。ミリ秒単位の応答が求められるレコメンデーションシステム(Recommender System […]
進化計算×LLM: モデリングから求解までの統合ワークフロー
大規模言語モデル(LLM: Large Language Model)を業務の意思決定に組み込もうとすると、「スケジューリングやリソース配分のような組合せ最適化問題に、LLMをどこまで使えるのか」という疑問にぶつかります […]
Strong-to-Weak Scaffolding: パラメータ更新なしで弱いモデルを鍛える推論時ハーネス設計
LLM(大規模言語モデル)を使ったエージェントシステムの実運用が広がるにつれて、コストの観点から小型・安価なモデルをどう活用するかが現実的な課題になっています。大型モデルに匹敵する性能を小型モデルに持たせる代表的な方法は […]
Skillware: 振る舞いがソフトウェアになる時代
Claude Code、GitHub Copilot、Codexといった主要なAgent Host上で、SKILL.md という1枚のファイルにタスクの手順を記述することでエージェントの振る舞いを拡張する「Agent S […]
SkillSight:AIエージェントのスキル検索精度を劇的に向上させる
エージェントが利用できるスキル(ツールやAPI、手順書などのドキュメント)は、SRA-Benchで約26,000件、SkillBench-Suppでは約77,000件におよびます。これほど大規模になると、膨大な選択肢から […]
Phantom Guardrails: 存在しない問題を修正するAIエージェント
近年、LLMベースのエージェントにおいて、自らのプロンプトやガードレールを修正し自己改善を進める「自動ハーネス最適化 (Automated Harness Optimization)」の導入が進んでいます。しかし、「観察 […]
Harness Handbook: AIエージェント進化のための「振る舞い中心」のコード管理
現代のAIエージェントの能力は、基盤モデル単体の性能だけで決まるわけではありません。プロンプトの構築、状態の管理、そしてツールの呼び出しなどを統制する「ハーネス(Harness)」と呼ばれる実行基盤が重要な役割を担ってい […]
ハーネス・エンジニアリング: 次世代エージェントの設計指針
近年、LLMベースのエージェントは単なる受動的な質問応答から、自律的に環境を認識し、長期的なタスクを完遂するシステムへと移行しています。このような機能的要件を満たすため、現在のエージェントは「認知エンジン」である基盤モデ […]