第2回:自然言語→SQL エージェントで KOI を測る ― 品質を守りながら費用対効果の高いモデルを選ぶ
自然言語で聞くと AI が SQL を生成して社内データベースに問い合わせる Text-to-SQL エージェントを題材に、5 つのモデルを KOI(KPI ÷ コスト)で実測しました。品質フロアを設けたうえで、最も費用対効果の高いモデルを選ぶ過程を、実測値と手順とともに紹介します。
43件の記事
自然言語で聞くと AI が SQL を生成して社内データベースに問い合わせる Text-to-SQL エージェントを題材に、5 つのモデルを KOI(KPI ÷ コスト)で実測しました。品質フロアを設けたうえで、最も費用対効果の高いモデルを選ぶ過程を、実測値と手順とともに紹介します。
Tokenmaxxing(トークン過剰消費)が招く経営リスク、その第一防衛線となるモデルルーター、そしてその先にある成果駆動型の最適化。入力駆動から成果駆動へと軸を移す指標 VOI・KOI と、それを実装するOSS「Nishiki」について考察します。
OpenClawをクラウドサーバーで運用した初日に、APIコストが想定の5〜10倍に膨らみました。原因の切り分けと、そこから導き出した3Tierモデル戦略をまとめます。
OpenClawのデフォルト構成(Gemini 3 Flash)にPythonのルールチェックコードを書かせたところ、25回の書き直しを経て正解値をハードコードする結果になりました。そこからエージェント構成を見直し、コード生成をClaudeに委任する形に変更した経緯と、改めて3モデルで比較した結果を整理します。
OpenClawのheartbeatが深夜に暴走し、2時間36分で1.29ドルを消費したインシデントの記録です。「空」の指示が暴走を招く理由と、フィードバックループを避けるための設計指針をまとめます。
Googleが生成AIで仮想試着を実現した。ならば自分のシステムでも試せるのではないか。PASTA-GAN++からGeminiとVertex AIへ——マルチステージGPUパイプラインを1回のAPI呼び出しに集約するまでの記録。
Geminiの画像生成を仮想試着に適用し、3フェーズにわたって体系的に検証。ノイズ入り画像、クリーン画像、高解像度アクションポーズ——導き出された結論は、前処理パイプラインより解像度が品質を決定するということだった。
3世代の仮想試着技術を12テストケースで直接比較。結果が示したのは漸進的な改善ではなく、世代的な飛躍だった。特にGANが根本的に失敗していた体型多様性の領域で、その差は決定的だった。
Pythonノートブックによるデータパイプラインの構築過程を解説。Wikipediaからのニュース収集、マクロ経済指標の時系列データ作成、そして株価シミュレーションまで、ゲームのリアリティを支えるデータ基盤を紹介します。