2026.8.28
変更ダイジェスト
主要トピック別サマリー
1. Confidential AIは所有者間の信頼を証明する
TDISP/Platform Attestation、TEE/CVM、GPU CC、Confidential Containers、暗号化ボリュームを組み合わせ、使用中データ、モデル、通信、ディスクを保護する。
データ所有者、モデル所有者、インフラ所有者が異なる場合、Secure BootからOS・アプリまでの計測結果をAttestationし、検証に成功した環境だけへ鍵を解放する設計が必要になる。
エージェント間通信を秘密メッシュへ閉じ込める構想では、外部エージェントとの動的連携、異種CCノード、GPUへの暗号化DMAが課題になる。bounce bufferによるレイテンシ増も推論TCOへ含める必要がある。
2. エージェントの長期運用はメモリと責任分界で決まる
デュアルメモリは、現在の目標・サブタスクを保持するワーキングメモリと、再利用可能なスキルを保存する実験メモリを分離する。トレースと検証ゲートで局所的に改善し、無制御な自己改変を避ける。
モデルルーティングでは、フロンティアモデルが計画・判断・レビュー、安価なモデルが定型実装を担う。セッション中の難度、キャッシュ、レビュー頻度、失敗時の再試行を制御する。
AIが店舗経営、医療、金融、法務の現場へ入ると、利益・安全・労働・説明責任の帰属が問題になる。AIを意思決定者に置く場合も、人間の承認と責任主体を残す必要がある。
3. ローカル巨大モデルは量子化・メモリ分割で実用化する
GLM-5.3 Flashは320B総パラメータ、18BアクティブのMoE、100万トークン、ネイティブマルチモーダルをMITライセンスで提供する。航空管制バグの修正やHTML生成で、長文コンテキストとツール利用を検証できる。
Dynamic 1-bit量子化では93GBモデルを5 GPUでロードし、128Kコンテキスト・最大推論努力で約33 tok/sを実現する。品質、推論トークン、GPU枚数、電力を併せて比較する必要がある。
FreeTokenはExpertをGPUへ、残りをRAMへ置く。GPU/CPU演算とPCIe転送を測ってOffloadまたはHybridを選び、KVキャッシュ、Expert LRU、VRAMを監視する。
4. RAGは金融・法務・医療の証拠レイヤーになる
Gemini Enterprise for Financial ServicesはFactSetなどの信頼できるコネクタと監査可能な分析を統合し、LegalはEverlawの証拠レイヤーを通じて回答を文書へ引用づける。
医療・金融の導入では、PII/PHIを匿名化・トークン化してからEmbeddingへ渡し、アクセス、保存期間、モデル利用、Human-in-the-loopを管理する。
目論見書の多数チェック、製薬のBMR/COA照合、患者情報のシフト前収集など、価値はモデルの流暢さではなく、数週間の作業を数時間・数日に短縮しながら監査できることにある。
5. vLLM・OpenAI ASIC・TCOは推論の経済性を再定義する
OpenAI Jalapeñoは推論のプリフィル/デコードに特化し、HBM4とラックスケール接続で高スループット・低電力を狙う。汎用GPUより効率的な一方、モデル構造の変化やAgenticワークロードへの適応性は未検証である。
SNIAの性能ベースTCOは、圧縮アクセラレーターでCPUコア、電力、ソフトウェアライセンス、処理時間を削減し、目標スループットあたりのコストで比較する。
推論基盤の比較には、GPU価格だけでなく、HBM/KVキャッシュ、SSD、NIC、800Gスイッチ、光モジュール、ラック電力、ライセンス、保守、稼働率を含める必要がある。
6. コードレビューとAI生成物の検証が新しいボトルネックになる
Tesla Code ReviewはPRタイトル・概要から意図を推定し、セキュリティ、設計、速度などのレビューレンズをコードベースの範囲へ適用する。レンズをスキルとしてバージョン管理・評価・配布することで、ブラックボックス化を避ける。
AI生成コードは量が増えるほど、人間レビューの認知負荷と誤承認リスクを高める。小さなPR、機械的テスト、意図に沿ったレンズ、責任者の承認を組み合わせる必要がある。
LinuxではAIがGPUデバッグや脆弱性発見を加速する一方、低品質パッチと誤報告がメンテナーを圧迫する。生成速度ではなく、アーキテクチャ理解と検証可能性を品質指標にする。
7. Linux・OSS・WebMCPは利用者側の制御を広げる
bat、fd、ripgrep、ncdu、btop、eza、gping、zoxideは、可読性、検索、ディスク・ネットワーク監視を向上させる。ただし、復旧環境や最小システムでは標準コマンドとの使い分けが必要である。
WebMCPはウェブサイト自身がAI向けのツール定義を公開し、モデルが機能を発見・操作できるようにする。説明、入力スキーマ、最小権限、不要ツールの削減が新しいUI設計要件になる。
AI時代の学習は文法暗記より、設計を読み、一次情報を確認し、長期運用で結果を検証する能力へ比重が移る。
8. 物理AIとインフラは現実の制約を受ける
Gatikのドライバーレストラックは、NVIDIA車載計算、Isuzuなどのパートナー、Take-or-Pay契約、アセットライトなTaaSで物流を拡大する。受注残と安全運行、保守、規制を分けて検証する必要がある。
データセンターでは、GPU需要が電力、水、騒音、送電網、地域政治と衝突する。AI投資のROIは、計算性能だけでなく許認可、地域還元、既存顧客の料金、障害復旧を含めるべきである。
AIが科学実験装置を直接操作する場合も、MHSのような共通インターフェース、安全範囲、クローズドループ検証が、実験速度と事故防止を両立する。
横断的な示唆
8/29の中心テーマは、モデルを「賢くする」ことから、信頼境界、データ証拠、メモリ、レビュー、TCO、現実の責任へ接続することである。
オープンモデル・OSS・自社ハーネスは、ベンダーロックインとデータ流出を抑える選択肢になるが、運用・監査・更新・復旧の責任を利用者側へ移す。
今後のTopic更新では、Attestationの再現性、スキル/レビューレンズの劣化、ルーティングのキャッシュ損失、引用完全性、GPU/ASICの実効TCO、物理AIの安全復帰を追跡する。
