<?xml version="1.0" encoding="UTF-8"?><urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"><url><loc>https://ai-systems-engineering.com/</loc></url><url><loc>https://ai-systems-engineering.com/en/</loc></url><url><loc>https://ai-systems-engineering.com/posts/llm-systems-engineering-introduction/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/llm-systems-engineering-introduction/</loc></url><url><loc>https://ai-systems-engineering.com/posts/embedding-to-lm-head/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/embedding-to-lm-head/</loc></url><url><loc>https://ai-systems-engineering.com/posts/residual-and-rmsnorm/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/residual-and-rmsnorm/</loc></url><url><loc>https://ai-systems-engineering.com/posts/attention-and-mlp/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/attention-and-mlp/</loc></url><url><loc>https://ai-systems-engineering.com/posts/attention-projections/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/attention-projections/</loc></url><url><loc>https://ai-systems-engineering.com/posts/core-attention/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/core-attention/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rope/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rope/</loc></url><url><loc>https://ai-systems-engineering.com/posts/moe/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/moe/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-summary/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-summary/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-mqa-gqa/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-mqa-gqa/</loc></url><url><loc>https://ai-systems-engineering.com/posts/cpu-and-gpu/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/cpu-and-gpu/</loc></url><url><loc>https://ai-systems-engineering.com/posts/gpu-architecture/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/gpu-architecture/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-operation-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-operation-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/posts/gpu-execution-and-warp-scheduling/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/gpu-execution-and-warp-scheduling/</loc></url><url><loc>https://ai-systems-engineering.com/posts/cpu-gpu-work-execution/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/cpu-gpu-work-execution/</loc></url><url><loc>https://ai-systems-engineering.com/posts/gpu-arithmetic-intensity-and-fusion/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/gpu-arithmetic-intensity-and-fusion/</loc></url><url><loc>https://ai-systems-engineering.com/posts/matmul-tiling-and-data-reuse/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/matmul-tiling-and-data-reuse/</loc></url><url><loc>https://ai-systems-engineering.com/posts/attention-memory-and-softmax/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/attention-memory-and-softmax/</loc></url><url><loc>https://ai-systems-engineering.com/posts/online-softmax/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/online-softmax/</loc></url><url><loc>https://ai-systems-engineering.com/posts/flash-attention/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/flash-attention/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-performance-and-bottlenecks/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-performance-and-bottlenecks/</loc></url><url><loc>https://ai-systems-engineering.com/posts/multi-gpu-execution/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/multi-gpu-execution/</loc></url><url><loc>https://ai-systems-engineering.com/posts/gpu-communication-basics/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/gpu-communication-basics/</loc></url><url><loc>https://ai-systems-engineering.com/posts/gpu-communication-engines/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/gpu-communication-engines/</loc></url><url><loc>https://ai-systems-engineering.com/posts/gpu-network-data-path/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/gpu-network-data-path/</loc></url><url><loc>https://ai-systems-engineering.com/posts/collective-communication-basics/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/collective-communication-basics/</loc></url><url><loc>https://ai-systems-engineering.com/posts/collective-communication-combinations/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/collective-communication-combinations/</loc></url><url><loc>https://ai-systems-engineering.com/posts/collective-ring-tree/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/collective-ring-tree/</loc></url><url><loc>https://ai-systems-engineering.com/posts/data-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/data-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/posts/tensor-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/tensor-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/posts/sequence-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/sequence-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/posts/context-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/context-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/posts/pipeline-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/pipeline-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/posts/expert-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/expert-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/posts/choosing-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/choosing-parallelism/</loc></url><url><loc>https://ai-systems-engineering.com/posts/inference-and-training/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/inference-and-training/</loc></url><url><loc>https://ai-systems-engineering.com/posts/inference-kv-cache/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/inference-kv-cache/</loc></url><url><loc>https://ai-systems-engineering.com/posts/prefill-and-decode/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/prefill-and-decode/</loc></url><url><loc>https://ai-systems-engineering.com/posts/batching-and-scheduling/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/batching-and-scheduling/</loc></url><url><loc>https://ai-systems-engineering.com/posts/paged-kv-cache/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/paged-kv-cache/</loc></url><url><loc>https://ai-systems-engineering.com/posts/inference-preemption/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/inference-preemption/</loc></url><url><loc>https://ai-systems-engineering.com/posts/inference-metrics/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/inference-metrics/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-mla-storage/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-mla-storage/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-token-actions/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-token-actions/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-reward-to-update/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-reward-to-update/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-mla-computation/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-mla-computation/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-local-sparse/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-local-sparse/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-critic-and-groups/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-critic-and-groups/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-sparse-indexer/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-sparse-indexer/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-on-policy-distillation/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-on-policy-distillation/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-training-strategy/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-training-strategy/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-system-architecture/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-system-architecture/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-token-context/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-token-context/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-quantized-training/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-quantized-training/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-token-compression/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-token-compression/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-delta-rule/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-delta-rule/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-gdn-kda/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-gdn-kda/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-probability-mismatch/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-probability-mismatch/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-async-staleness/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-async-staleness/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-rollout-inference/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-rollout-inference/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-program-scheduling/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-program-scheduling/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-weight-sync/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-weight-sync/</loc></url><url><loc>https://ai-systems-engineering.com/posts/rl-summary/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/rl-summary/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-linear-attention/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-linear-attention/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-ssm-basics/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-ssm-basics/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-mamba-selective/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-mamba-selective/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-hybrid/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-hybrid/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-hc-mhc/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-hc-mhc/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-gated-residual/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-gated-residual/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-attention-residuals/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-attention-residuals/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-cross-layer-kv/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-cross-layer-kv/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-yoco/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-yoco/</loc></url><url><loc>https://ai-systems-engineering.com/posts/model-advanced-ced/</loc></url><url><loc>https://ai-systems-engineering.com/en/posts/model-advanced-ced/</loc></url></urlset>