AREX-Skill: GitHubリポジトリからAI研究を加速させる専門知識を蒸留する方法

自律的にコードを書き、実験を回し、結果を比較する「エージェント」が、機械学習研究の現場に入り込み始めています。もっとも、こうしたエージェントを実際に使ってみると、有名なライブラリの使い方を一つ間違えるだけで実験全体が無駄 […]

AIエージェントの信頼性を決定づけるハーネス設計の最前線

LLMエージェントを本番環境で運用し始めると、多くの開発者が共通の課題に直面します。温度パラメータ(temperature)を下げて同一の入力を与えた場合でも、実行ごとにツールの呼び出し順序や最終出力が微妙に変動してしま […]

ASI-Bench: 科学的超知能への道のりと自理性の壁

LLMエージェントがコーディングやデータ分析、長時間にわたるタスク遂行など、様々なベンチマークで高いスコアを記録するようになってきました。そうした中で「AIは自律的に科学研究を進められるのか」という問いは、研究の場だけで […]

進化計算×LLM: モデリングから求解までの統合ワークフロー

大規模言語モデル(LLM: Large Language Model)を業務の意思決定に組み込もうとすると、「スケジューリングやリソース配分のような組合せ最適化問題に、LLMをどこまで使えるのか」という疑問にぶつかります […]

Strong-to-Weak Scaffolding: パラメータ更新なしで弱いモデルを鍛える推論時ハーネス設計

LLM(大規模言語モデル)を使ったエージェントシステムの実運用が広がるにつれて、コストの観点から小型・安価なモデルをどう活用するかが現実的な課題になっています。大型モデルに匹敵する性能を小型モデルに持たせる代表的な方法は […]

宇宙物理学における基盤モデル

近年、深層学習を大量のデータで一度事前学習し、それを多様なタスクに使い回す「基盤モデル(Foundation Model)」という言葉が、天文学のデータ解析でも目にする機会が増えています。ただし、Transformerを […]

DiffusionGemma: 拡散言語モデルの仕組み

大規模言語モデル(LLM)をチャットボットや対話型エージェントとして、単発かつ低同時接続で動かす場面では、生成速度が伸びずにもどかしさを感じることがあります。この種のワークロードでは、モデルの重みや会話履歴のキャッシュを […]

YOLOv14: 魚眼・ゲーム画像・空撮・360°パノラマに強い物体検出器の設計

監視カメラや車載カメラの多くは魚眼レンズや広角レンズを採用しており、ドローンや360度カメラの映像を解析する場面も珍しくなくなっています。加えて、ゲーム実況やeスポーツ分析の現場では、実写ではなくゲームエンジンがレンダリ […]