<?xml version="1.0" encoding="UTF-8"?><urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9" xmlns:news="http://www.google.com/schemas/sitemap-news/0.9" xmlns:xhtml="http://www.w3.org/1999/xhtml" xmlns:image="http://www.google.com/schemas/sitemap-image/1.1" xmlns:video="http://www.google.com/schemas/sitemap-video/1.1"><url><loc>https://akshathtiwari.co.in/</loc></url><url><loc>https://akshathtiwari.co.in/blog/</loc></url><url><loc>https://akshathtiwari.co.in/blog/attention-quadratic-complexity/</loc></url><url><loc>https://akshathtiwari.co.in/blog/causal-masking-decoder-transformers/</loc></url><url><loc>https://akshathtiwari.co.in/blog/completions-only-loss-finetuning/</loc></url><url><loc>https://akshathtiwari.co.in/blog/compression-is-intelligence/</loc></url><url><loc>https://akshathtiwari.co.in/blog/dflash/</loc></url><url><loc>https://akshathtiwari.co.in/blog/dspark/</loc></url><url><loc>https://akshathtiwari.co.in/blog/flashattention/</loc></url><url><loc>https://akshathtiwari.co.in/blog/gepa/</loc></url><url><loc>https://akshathtiwari.co.in/blog/kimi-delta-attention/</loc></url><url><loc>https://akshathtiwari.co.in/blog/language-modeling-next-token/</loc></url><url><loc>https://akshathtiwari.co.in/blog/linformer/</loc></url><url><loc>https://akshathtiwari.co.in/blog/longformer-bigbird/</loc></url><url><loc>https://akshathtiwari.co.in/blog/mamba-ssm/</loc></url><url><loc>https://akshathtiwari.co.in/blog/mla/</loc></url><url><loc>https://akshathtiwari.co.in/blog/mqa-gqa/</loc></url><url><loc>https://akshathtiwari.co.in/blog/multi-head-attention/</loc></url><url><loc>https://akshathtiwari.co.in/blog/performer/</loc></url><url><loc>https://akshathtiwari.co.in/blog/pre-transformer-to-attention/</loc></url><url><loc>https://akshathtiwari.co.in/blog/reformer/</loc></url><url><loc>https://akshathtiwari.co.in/blog/residual-connections-attention-residuals/</loc></url><url><loc>https://akshathtiwari.co.in/blog/scaled-dot-product-attention/</loc></url><url><loc>https://akshathtiwari.co.in/blog/skillopt/</loc></url><url><loc>https://akshathtiwari.co.in/blog/sliding-window-attention/</loc></url><url><loc>https://akshathtiwari.co.in/blog/sparse-transformer/</loc></url><url><loc>https://akshathtiwari.co.in/blog/speculative-decoding/</loc></url><url><loc>https://akshathtiwari.co.in/blog/token-embeddings-from-scratch/</loc></url><url><loc>https://akshathtiwari.co.in/blog/tokenization-from-scratch/</loc></url><url><loc>https://akshathtiwari.co.in/blog/transformer-evolution-map/</loc></url><url><loc>https://akshathtiwari.co.in/blog/why-small-models-beat-gpt4/</loc></url><url><loc>https://akshathtiwari.co.in/blog/why-we-scale-attention/</loc></url><url><loc>https://akshathtiwari.co.in/contact/</loc></url><url><loc>https://akshathtiwari.co.in/experience/</loc></url><url><loc>https://akshathtiwari.co.in/notes/</loc></url><url><loc>https://akshathtiwari.co.in/notes/compression-and-information/</loc></url><url><loc>https://akshathtiwari.co.in/papers/</loc></url><url><loc>https://akshathtiwari.co.in/projects/</loc></url><url><loc>https://akshathtiwari.co.in/projects/01-fitscore-finetuning/</loc></url><url><loc>https://akshathtiwari.co.in/projects/02-fitscore-production-service/</loc></url><url><loc>https://akshathtiwari.co.in/projects/03-gepa-prompt-optimization/</loc></url><url><loc>https://akshathtiwari.co.in/projects/04-argilla-golden-data/</loc></url><url><loc>https://akshathtiwari.co.in/projects/05-deep-research-agent/</loc></url><url><loc>https://akshathtiwari.co.in/projects/06-open-deep-research/</loc></url><url><loc>https://akshathtiwari.co.in/projects/07-vllm-benchmarking/</loc></url><url><loc>https://akshathtiwari.co.in/projects/08-gpt-from-scratch/</loc></url><url><loc>https://akshathtiwari.co.in/projects/09-positional-embeddings/</loc></url><url><loc>https://akshathtiwari.co.in/volunteer/</loc></url></urlset>