<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"
        xmlns:image="http://www.google.com/schemas/sitemap-image/1.1">
  <url>
    <loc>https://clinicalbench.github.io/</loc>
    <lastmod>2026-08-14</lastmod>
    <changefreq>monthly</changefreq>
    <priority>1.0</priority>
    <image:image>
      <image:loc>https://clinicalbench.github.io/static/images/framework.png</image:loc>
      <image:title>Overview of ClinicalBench</image:title>
      <image:caption>ClinicalBench framework: three clinical prediction tasks over MIMIC-III and MIMIC-IV, code-to-text conversion, and the benchmarked traditional ML models and LLMs.</image:caption>
    </image:image>
    <image:image>
      <image:loc>https://clinicalbench.github.io/static/images/confusion_matrix.png</image:loc>
      <image:title>Confusion matrices on Mortality Prediction</image:title>
      <image:caption>Confusion matrices for XGBoost, Transformer, Llama3-8B and Meditron-7B on Mortality Prediction in MIMIC-III.</image:caption>
    </image:image>
    <image:image>
      <image:loc>https://clinicalbench.github.io/static/images/fine_tuning.png</image:loc>
      <image:title>Fine-tuned LLMs versus traditional ML models</image:title>
      <image:caption>LoRA fine-tuning results for four LLMs across three clinical prediction tasks and two databases.</image:caption>
    </image:image>
    <image:image>
      <image:loc>https://clinicalbench.github.io/static/images/temperature_length.png</image:loc>
      <image:title>Decoding temperature versus Macro F1</image:title>
      <image:caption>Macro F1 of 15 LLMs across decoding temperatures on Length-of-Stay Prediction in MIMIC-III.</image:caption>
    </image:image>
  </url>
</urlset>
