ブログ

エンジニアリングノート

AIアーキテクチャの深掘りと、私たちが作っているものの近況。

推論

大規模LLMサービング:推論アーキテクチャとコスト最適化

注目を集めるのは学習ですが、請求が発生するのは推論——リクエストごと、毎日です。大規模言語モデルを安く速く提供することは、それ自体が一つのアーキテクチャの規律です。最も効く要素を紹介します。

続きを読む →
エージェント

エージェント型AIの設計:マルチエージェント・ワークフローのオーケストレーション

エージェントとは、計画し、ツールを呼び出し、結果を観察し、次の行動を決められる言語モデルです。プロンプトを数個つなぐのは簡単ですが、信頼性が高く、範囲が限定され、デバッグ可能なエージェントシステムを作るのはアーキテクチャの課題です。私たちの取り組み方を紹介します。

続きを読む →
RAG

本番品質のRAGシステムを設計する

検索拡張生成(RAG)は、大規模言語モデルを自社データに根拠づける標準的な手法になりました。デモは簡単ですが、本番システムはそうではありません。その差はアーキテクチャ——どう取り込み、検索し、ランク付けし、評価するか——にあります。

続きを読む →