Transformer実践ガイド
画像・音声・時系列からエージェントまで
- Nicole Koenigstein 著、中山 光樹 訳
- 2026年10月 発行
- 384ページ
- ISBN978-4-8144-0183-3
- フォーマット Print PDF ePub
- 原書: Transformers: The Definitive Guide
5,280円
書籍のご注文はオーム社サイトへ
内容
Transformerの基礎からマルチモーダル、推論、最適化、デプロイ、AIエージェントまでを一貫して学べる実践ガイド。画像、動画、音声、時系列へ広がる応用を通して、Transformerを個々のモデルではなく知的システムの構成要素として理解し、本番環境での設計、実装、運用に生かすための視点と、実務で直面するトレードオフへの対応力を身につけられます。
関連書籍
目次
賞賛の声
訳者まえがき
まえがき
1章 第一原理から最先端のTransformer へ
1.1 Transformer の基礎
1.1.1 トークナイザー:Transformer におけるテキスト表現
1.1.2 トークン埋め込みと位置埋め込み
1.1.3 アテンション機構
1.1.4 エンコーダとデコーダ
1.2 Transformer 設計の拡張:長いコンテキストとアテンションのバリエーション
1.2.1 大きなコンテキストウィンドウによる性能向上
1.2.2 アテンション機構のバリエーション
1.3 まとめ
2章 時系列データのためのTransformer
2.1 時系列データの特性
2.1.1 自己相関と偏自己相関
2.1.2 共和分
2.1.3 相互相関
2.1.4 定常性
2.1.5 トレンドと季節性
2.1.6 データセットの準備
2.2 さまざまな応用領域における時系列モデリング
2.3 時系列データのトークン化
2.4 Chronos:時系列の言語を学習する
2.4.1 Chronos のファインチューニング
2.5 PatchTST:1 本の時系列は64 語に値する
2.5.1 IBM の過去株価に対するPatchTST のファインチューニング
2.6 TimesFM:デコーダ専用の時系列基盤モデル
2.6.1 TimesFM のファインチューニング
2.7 自己教師あり異常検知のためのAnomalyBERT
2.8 まとめ
3章 ビジョンタスクのためのTransformer
3.1 さまざまなビジョンタスクの概要
3.2 ビジョンモデルにおける埋め込みとトークン化
3.3 ビジョンタスクの頑健性と有効性を向上させるための主要戦略
3.4 Swin Transformer V2
3.4.1 Swin Transformer V2 による画像分類
3.5 Segment Anything Model:画像セグメンテーション
3.5.1 SAM の全体像
3.5.2 サンプル画像を読み込む
3.5.3 1 つの点で対象を指定する
3.5.4 点プロンプトからマスクを生成する
3.5.5 複数の候補マスクを表示する
3.5.6 点を追加してマスクを改善する
3.5.7 矩形プロンプトで対象を指定する
3.5.8 画像埋め込みを再利用する
3.5.9 SAM の各コンポーネント
3.5.10 カスタムデータセットに対するSAM のファインチューニング
3.6 Segment Anything Model 2:画像と動画のセグメンテーション
3.6.1 SAM 2 の全体像
3.6.2 SAM 2 による動画セグメンテーション
3.6.3 SAM 2 の学習データと性能
3.7 Segment Anything Model 3:コンセプトプロンプトによる画像と動画のセグメンテーション
3.8 まとめ
4章 画像生成のためのTransformer
4.1 画像生成モデル入門
4.1.1 拡散モデル:そのノイズは何なのか?
4.1.2 拡散モデルにおける分類器なしガイダンス
4.2 Transformer を用いたスケーラブルな拡散モデル
4.2.1 DiT による画像生成
4.3 PixArt-α
4.4 PixArt-Σ
4.4.1 PixArt-Σによる画像生成
4.5 画像生成のためのDiffusion Vision Transformers
4.6 Diffusion Transformer による解釈可能な特徴
4.7 まとめ
5章 動画生成のためのTransformer
5.1 潜在拡散の隠れた有効性
5.2 LTX-Video:リアルタイム動画生成
5.3 Latte:あらゆる動画フレームに注ぎ込まれた構造的な細部
5.4 Tora:軌跡からストーリーラインへ、フレームごとに生成
5.5 まとめ
6章 音声領域におけるTransformer
6.1 波形からスペクトログラムへ:音声データの構造を理解する
6.1.1 波形としての音声
6.1.2 サンプリングレートとナイキストの定理
6.1.3 振幅、ビット深度、量子化
6.1.4 周波数領域とフーリエ変換
6.1.5 スペクトログラムと短時間フーリエ変換
6.1.6 メルスペクトログラムと知覚尺度化
6.1.7 位相、再構成、ボコーダ
6.2 さまざまな応用領域における音声モデリング
6.3 音声向けのTransformer アーキテクチャ
6.3.1 Speech Transformer の台頭:Whisper の影響
6.3.2 音声基盤モデル
6.3.3 Qwen2-Audio
6.3.4 Kimi-Audio による会議の文字起こし
6.3.5 音声におけるSegment Anything
6.3.6 Transformer による音楽生成
6.4 まとめ
7章 強化学習におけるTransformer
7.1 強化学習の基本要素
7.2 強化学習手法の分類
7.2.1 オンライン強化学習とオフライン強化学習
7.2.2 モデルベース手法とモデルフリー手法
7.2.3 方策オン型強化学習と方策オフ型強化学習
7.2.4 時間的差分学習
7.2.5 強化学習における世界モデル
7.3 強化学習におけるTransformer
7.3.1 Decision Transformer
7.3.2 Online Decision Transformer
7.3.3 確率的Transformer ベース世界モデル
7.3.4 TWISTER:対照予測符号化を用いたTransformer ベースの世界モデル
7.4 まとめ
8章 経験の時代を受け入れる:計画、推論、コーディングのためのTransformer
8.1 人間が与えたデータから、モデル自身の経験へ
8.2 推論を学習する:事前学習から強化学習へ
8.3 DeepSeek-R1:推論能力を強化する
8.4 Qwen3:思考モードの動的な制御
8.5 Qwen3-Coder:実践的なコーディングのためのエージェント型推論
8.6 Kimi K2:大規模なオープンエージェント型モデル
8.6.1 Kimi K2 による推論
8.7 推論時スケーリング:モデルサイズではなく思考時間を増やす
8.7.1 適応的分岐モンテカルロ木探索
8.7.2 コード生成のためのRethinkMCTS フレームワーク
8.7.3 コード生成のためのS* フレームワーク
8.8 まとめ
9章 スクリプトから思考へ:複雑なタスクのためのAI エージェント
9.1 自律性:現時点で何が可能か
9.2 エージェントワークフローの設計
9.2.1 マルチエージェントアーキテクチャ
9.3 エージェント型コミュニケーション:コンテキストの重要性
9.4 コンテキストを超えて:エージェントの記憶を支援する方法
9.4.1 エージェントにおける記憶の種類
9.4.2 ローカルメモリから共有メモリ、生涯メモリへ
9.5 人間による介入:エージェントの行動を監督する
9.5.1 Human-in-the-Loop の一般的なパターン
9.6 コーディングエージェントでGitHub Issue を解決する
9.7 まとめ
10章 より賢く、より良く、より速く、より強く:LLM とAI エージェントの最適化
10.1 学習時最適化:エージェントのための強化学習
10.1.1 手作業で設計された報酬を超えて:RULER の仕組み
10.1.2 実践での学習手順:市場シナリオにおけるART
10.2 力任せにではなく、賢く推論する:適応的な計算資源割り当て
10.2.1 デルタインセンティブ:効率性の強制
10.3 オープンイノベーション:コミュニティ主導の強化学習フレームワーク
10.4 Checkpoint Engine:LLM 方策更新のためのシステムレベル最適化
10.5 まとめ
11章 Transformer モデルのデプロイ
11.1 オープンモデルとクローズドモデルの選択
11.2 デプロイするモデルのアーキテクチャを理解する
11.3 デコーダのみのモデルのデプロイ
11.3.1 ランタイムエンジニアリング
11.3.2 セキュリティ上の考慮事項
11.4 コーディングモデルによるアプリケーションの構築
11.5 本番環境におけるLLM デプロイの評価
11.5.1 コスト効率とハードウェアの比較
11.6 量子化
11.7 ビジョン言語モデルにおけるテスト時低ランク適応
11.8 まとめ
12章 次に進むべき場所:モデルから知的システムへ
12.1 MLLM とSAM 3 の能力を組み合わせるエージェントシステム
12.2 エージェント型システムのスケーリングの科学
12.3 まとめ
索引