<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9" xmlns:image="http://www.google.com/schemas/sitemap-image/1.1">
<url>
<loc>https://therewardsignal.com</loc>
<lastmod>2026-10-01T21:55:39.599Z</lastmod>
<changefreq>daily</changefreq>
<priority>1</priority>
</url>
<url>
<loc>https://therewardsignal.com/sections/reward-model-engineering</loc>
<lastmod>2026-09-18T21:09:39.411Z</lastmod>
<changefreq>weekly</changefreq>
<priority>0.5</priority>
</url>
<url>
<loc>https://therewardsignal.com/sections/rlhf-foundations</loc>
<lastmod>2026-09-10T02:50:57.983Z</lastmod>
<changefreq>weekly</changefreq>
<priority>0.5</priority>
</url>
<url>
<loc>https://therewardsignal.com/sections/post-training-pipelines</loc>
<lastmod>2026-09-26T06:25:15.321Z</lastmod>
<changefreq>weekly</changefreq>
<priority>0.5</priority>
</url>
<url>
<loc>https://therewardsignal.com/sections/rlhf-tooling</loc>
<lastmod>2026-10-01T21:55:39.599Z</lastmod>
<changefreq>weekly</changefreq>
<priority>0.5</priority>
</url>
<url>
<loc>https://therewardsignal.com/sections/features</loc>
<lastmod>2026-08-11T15:10:35.269Z</lastmod>
<changefreq>weekly</changefreq>
<priority>0.5</priority>
</url>
<url>
<loc>https://therewardsignal.com/authors/devon-achterberg</loc>
<lastmod>2026-10-01T21:55:39.599Z</lastmod>
<changefreq>weekly</changefreq>
<priority>0.4</priority>
</url>
<url>
<loc>https://therewardsignal.com/authors/anjali-raghunathan</loc>
<lastmod>2026-10-01T21:55:39.599Z</lastmod>
<changefreq>weekly</changefreq>
<priority>0.4</priority>
</url>
<url>
<loc>https://therewardsignal.com/authors/cassiel-oduya</loc>
<lastmod>2026-10-01T21:55:39.599Z</lastmod>
<changefreq>weekly</changefreq>
<priority>0.4</priority>
</url>
<url>
<loc>https://therewardsignal.com/authors/marta-wierzbicka</loc>
<lastmod>2026-10-01T21:55:39.599Z</lastmod>
<changefreq>weekly</changefreq>
<priority>0.4</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/experiment-tracking-for-rlhf-runs-with-weights-and-biases</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/2f5b64cd-0d3f-48df-af0c-229f1165fd23/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/36c50f43-333a-41e2-8f8d-ab2143365606.jpeg</image:loc>
</image:image>
<lastmod>2026-10-01T21:55:39.599Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/reward-model-serving-latency-in-online-rl-training-loops</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/2f5b64cd-0d3f-48df-af0c-229f1165fd23/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/3976afe1-ea98-4540-963b-d0bd2d8a60fe.jpeg</image:loc>
</image:image>
<lastmod>2026-09-30T22:05:52.431Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/annotation-platform-selection-for-preference-data-collection</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/2f5b64cd-0d3f-48df-af0c-229f1165fd23/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/87872e48-bb63-4a65-85c7-7188f597d29a.jpeg</image:loc>
</image:image>
<lastmod>2026-09-30T17:31:19.625Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/distributed-rollout-generation-for-large-scale-ppo-training</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/2f5b64cd-0d3f-48df-af0c-229f1165fd23/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/b5f4bd4f-c47e-463d-835f-a8522273dba3.jpeg</image:loc>
</image:image>
<lastmod>2026-09-30T16:31:18.993Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/trl-library-architecture-for-rlhf-practitioners</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/2f5b64cd-0d3f-48df-af0c-229f1165fd23/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/64e0c74f-1eed-45bf-8b63-a13ea087790e.jpeg</image:loc>
</image:image>
<lastmod>2026-09-29T10:20:32.962Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/grpo-vs-ppo-for-large-language-model-fine-tuning</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/2f5b64cd-0d3f-48df-af0c-229f1165fd23/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/ed779736-20b2-49e0-8a6e-c5421e110fd2.jpeg</image:loc>
</image:image>
<lastmod>2026-09-26T06:25:15.321Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/catastrophic-forgetting-in-rl-fine-tuned-language-models</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/2f5b64cd-0d3f-48df-af0c-229f1165fd23/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/b1dd08d5-4f59-45f6-ae32-bae7b7eb70b1.jpeg</image:loc>
</image:image>
<lastmod>2026-09-25T01:54:26.680Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/iterative-online-rlhf-with-continuously-updated-preference-data</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/d5dae766-3be9-4878-b97e-8325dc8a1bfb.jpeg</image:loc>
</image:image>
<lastmod>2026-09-24T01:49:43.239Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/rejection-sampling-fine-tuning-as-an-rl-alternative</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/f452d635-7dbe-45bb-9669-fbfdec670408.jpeg</image:loc>
</image:image>
<lastmod>2026-09-22T22:20:24.807Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/compute-budget-allocation-across-rlhf-pipeline-stages</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/a855b1c9-8fd7-4d91-87bc-511a5b5aa4b3.jpeg</image:loc>
</image:image>
<lastmod>2026-09-21T21:25:00.401Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/multi-stage-post-training-order-for-instruction-following-models</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/1b756415-8f3a-49b3-a99e-fcb898f44daf.jpeg</image:loc>
</image:image>
<lastmod>2026-09-20T22:04:11.443Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/calibration-of-learned-reward-models-against-human-ratings</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/1839177b-fc0d-4e00-910d-b953876a8e49.jpeg</image:loc>
</image:image>
<lastmod>2026-09-18T21:09:39.411Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/reward-model-checkpoint-selection-criteria</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/a2d65e62-1b41-49fe-ab33-5c444eca664b.jpeg</image:loc>
</image:image>
<lastmod>2026-09-17T22:04:06.866Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/process-reward-models-for-multi-step-reasoning</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/7753e67f-5b6b-4ee3-80ea-e84b84450b86.jpeg</image:loc>
</image:image>
<lastmod>2026-09-16T21:59:19.858Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/pointwise-vs-pairwise-vs-listwise-reward-training-objectives</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/3749af3b-8fec-4328-875f-f100ecc64b66.jpeg</image:loc>
</image:image>
<lastmod>2026-09-15T23:08:28.203Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/length-bias-in-reward-model-training</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/9c20a564-f336-4d67-aa38-0b39c36c40af.jpeg</image:loc>
</image:image>
<lastmod>2026-09-15T22:39:09.462Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/reward-model-generalization-across-out-of-distribution-prompts</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/9ca48c54-4605-4b4c-b4a8-f932b18599ff.jpeg</image:loc>
</image:image>
<lastmod>2026-09-15T21:23:49.651Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/verifiable-reward-design-for-code-generation-tasks</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/ac16a24f-dbb0-46b2-820c-8ea24c6967e4.jpeg</image:loc>
</image:image>
<lastmod>2026-09-12T22:42:53.351Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/reward-model-ensembling-for-uncertainty-estimation</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/cd8af5a5-830a-4750-ab38-40749c02c1d2.jpeg</image:loc>
</image:image>
<lastmod>2026-09-12T00:51:17.105Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/preference-dataset-quality-metrics-for-rlhf</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/59f5e7a4-eb22-4711-83c0-317f010cd838.jpeg</image:loc>
</image:image>
<lastmod>2026-09-10T02:50:57.983Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/implicit-reward-models-in-offline-preference-learning</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/f4cb6995-8e98-436c-98fb-bea99297ce24.jpeg</image:loc>
</image:image>
<lastmod>2026-09-08T20:00:04.406Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/constitutional-ai-self-critique-loop-mechanics</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/e770dda0-fe16-4508-baca-6f577dce2aa5.jpeg</image:loc>
</image:image>
<lastmod>2026-09-06T21:32:15.109Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/direct-preference-optimization-vs-ppo-for-instruction-tuning</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/f518339c-a2ba-441b-8d2a-3d826e05061b.jpeg</image:loc>
</image:image>
<lastmod>2026-09-05T22:57:57.283Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/kl-divergence-penalty-tuning-in-ppo-for-llms</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/6a561b30-321c-43b0-ba17-f55d7019ac7e.jpeg</image:loc>
</image:image>
<lastmod>2026-09-04T23:21:39.939Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/bradley-terry-model-assumptions-in-preference-learning</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/002663fd-d43a-4d4b-9b97-f60e8ab71896.jpeg</image:loc>
</image:image>
<lastmod>2026-09-03T22:09:35.216Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/reward-hacking-in-rlhf-fine-tuning</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/5f8d5e61-d35d-4f1f-b60c-2daa2654c4fd.png</image:loc>
</image:image>
<lastmod>2026-09-02T20:49:37.947Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/reward-hacking-in-long-horizon-coding-agents-how-verifiable-rewards-get-gamed-an</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/6dd7be67-eec1-4c60-86df-df0e3fcd1f91.jpeg</image:loc>
</image:image>
<lastmod>2026-08-11T15:10:35.269Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
<url>
<loc>https://therewardsignal.com/posts/turning-an-eval-suite-into-an-rl-environment-what-breaks-when-a-benchmark-become</loc>
<image:image>
<image:loc>https://mcxtywzsmeezbwapdahq.supabase.co/storage/v1/object/public/canvas-images/259cb55d-45f0-4472-92b7-c5daf13cdc2f/canvas/f1a6c62c-0646-4ffa-9b26-b0582b148503/generated/166fc110-ddf4-4383-8ed9-420a588f39ae.jpeg</image:loc>
</image:image>
<lastmod>2026-08-11T15:08:13.604Z</lastmod>
<changefreq>monthly</changefreq>
<priority>0.7</priority>
</url>
</urlset>
