第3話. TANREN — 進化したキャッシュ方策を、本物の vLLM に差し込んで測る
シミュレーションで勝った追い出し方策を、稼働中の vLLM に組み込んで実機で測りました。一度は「シミュレーションの勝ちが実機で消える」という失敗を経て、測る場所と指標を見直し、メモリ圧下のテール応答(p99 TTFT)を 13〜16% 短縮するに至った記録です。試作実装の代償や、効果が出ない条件も実測のまま記載します。
Blog
シミュレーションで勝った追い出し方策を、稼働中の vLLM に組み込んで実機で測りました。一度は「シミュレーションの勝ちが実機で消える」という失敗を経て、測る場所と指標を見直し、メモリ圧下のテール応答(p99 TTFT)を 13〜16% 短縮するに至った記録です。試作実装の代償や、効果が出ない条件も実測のまま記載します。
連載 LLM サービングの心臓部であるスケジューラを進化で作り、本物の vLLM に組み込んで実機 A/B 測定した記録です。実トレース 16 構成で既定の FCFS に 15 勝(p=2.6×10⁻⁴)、重負荷では mean/p99 とも 35〜49% 短縮、空いているときは悪影響ゼロでした。一度では勝てず、未知データで 0 勝 6 敗の全敗から原因分析を 6 周した過程も記載します。
安価な LLM がコードを書き、決定論の検証器が採点する進化のループが、128 バイトの RAM だけを頼りに Atari Pong の理論上限(40 試合すべてで 21–0)に届き、誰にも教わらず「必殺の一打」を発見するまで。正直なプロトコルと、数ドルで成立させた診断ループも記載します。
Metaが余剰AI計算資源を外部に貸し出す構想を受け、Neocloud銘柄が売られました。しかし価格・設備投資・広告AIを見ると、Meta Computeは計算資源デフレのサインではなく、データセンターを複数の収益ルートを持つ『レンタル資産』へ変える動きだと考えます。
自然言語で聞くと AI が SQL を生成して社内データベースに問い合わせる Text-to-SQL エージェントを題材に、5 つのモデルを KOI(KPI ÷ コスト)で実測しました。品質フロアを設けたうえで、最も費用対効果の高いモデルを選ぶ過程を、実測値と手順とともに紹介します。
Tokenmaxxing(トークン過剰消費)が招く経営リスク、その第一防衛線となるモデルルーター、そしてその先にある成果駆動型の最適化。入力駆動から成果駆動へと軸を移す指標 VOI・KOI と、それを実装するOSS「Nishiki」について考察します。
GPUやASICが「部品」から価値保存手段・不動産・そしてレバレッジ型金融商品へと姿を変えています。CoreWeave、SPV、レバレッジド・ローンとCLOの広がりを追い、2008年のサブプライムとの構造的な類似点とリスクを冷静に検証します。
AIによる効率化は、本当に需要や雇用を奪うのか。経済学のジェボンズのパラドックスを軸に、メモリ・推論コスト・エネルギー・労働の現場で起きている「需要の反転現象」を、事実に基づいて考察します。
1.75兆ドル規模と報じられるSpaceX IPOは、ロケット企業の上場ではありません。現金を生むStarlinkと、旧xAIを取り込んだSpaceXAIをひとつのバランスシートでどう値付けするかという問題として整理します。