Empowering Meta-analysis: Leveraging Large Language Models for Scientific Synthesis

Jawad Ibn Ahad, Rafeed Mohammad Sultan, Abraham Kaikobad, Fuad Rahman, Mohammad Ruhul Amin, Nabeel Mohammed, Shafin Rahman

โœ… Accepted at IEEE International Conference on Big Data 2024

๐Ÿ“„ Paper: IEEE Xplore
๐Ÿ’ป Code & Dataset: github.com/EncryptedBinary/Meta_analysis


Abstract

This study investigates automating meta-analysis in scientific documents using large language models (LLMs). Meta-analysis synthesizes findings from multiple studies but is labor-intensive when done manually. Our approach fine-tunes LLMs for efficient, automated meta-analysis using Retrieval Augmented Generation (RAG) and a novel loss metric, Inverse Cosine Distance (ICD). The fine-tuned models achieved 87.6% relevant meta-analysis abstracts and reduced irrelevance from 4.56% to 1.9%, demonstrating efficiency in a low-resource environment.


Introduction

Scientific meta-analysis requires experts to read, compare, and synthesize hundreds of papers โ€” a bottleneck that limits knowledge discovery at scale. LLMs offer a promising route to automation, but standard fine-tuning on context-length-restricted models produces incoherent or irrelevant summaries. Two core challenges: (1) input papers exceed LLM context windows, and (2) standard cross-entropy loss does not penalize semantically irrelevant outputs.

We address both via chunked RAG pipelines and a semantic-distance-aware loss function.


๐ŸŽฏ Key Contributions

  • Inverse Cosine Distance (ICD) Loss โ€” A novel training objective that minimizes semantic distance between generated and reference meta-analysis abstracts, replacing standard CE loss.
  • RAG-based Context Management โ€” Chunking and semantic retrieval to handle papers exceeding LLM context limits (up to 32K tokens โ†’ manageable 2K chunks).
  • Meta-Analysis Dataset (MAD) โ€” 625 annotated scientific document clusters with human-evaluated meta-analysis abstracts.
  • Low-Resource Efficiency โ€” Fine-tuned 7B models achieve better BLEU/ROUGE than GPT-4 baselines on domain-specific datasets.

Methodology

Meta-Analysis Pipeline

Figure: Three approaches compared โ€” (a) Paraphraser-based, (b) Standard RAG, (c) Our approach: fine-tuned LLMs with ICD loss and RAG. Input studies are chunked and encoded; relevant chunks retrieved via semantic search; fine-tuned LLM synthesizes the meta-analysis abstract under ICD supervision.

Dataset Statistics

MetricActualChunked
Min. input context length7331,005
Max. input context length32,7672,000
Avg. input context length16,8901,542
Total Instances6257,447
  • Train / Validation / Test: 400 / 75 / 50 documents
  • Human Evaluators: 13 annotators (9M, 4F), avg. age 23

๐Ÿ“Š Results โ€” Full Model Comparison Across 3 Datasets

MethodModelOpen-i BLEU โ†‘Open-i ROUGE โ†‘writer_sum. BLEU โ†‘writer_sum. ROUGE โ†‘CL-SciSumm BLEU โ†‘CL-SciSumm ROUGE โ†‘
EstablishedGPT-4 w/ ICL46.068.2โ€”โ€”โ€”โ€”
EstablishedInstructGPT davinci v2โ€”โ€”โ€”โ€”48.0โ€”
EstablishedGCN Hybridโ€”โ€”โ€”โ€”โ€”33.88
Pre-trainedFalcon 7B0.193.170.765.190.712.21
Pre-trainedGemma 7B2.138.814.4730.282.4420.78
Pre-trainedOrca-2 7B3.538.364.2922.512.8615.55
Pre-trainedStableLM-Base-Alpha 7B2.012.453.5615.361.1716.58
Pre-trainedLlama-2 7B4.8110.285.2131.613.0122.84
Pre-trainedMistral-v0.1 7B1.216.571.626.370.362.55
Ours (FT+ICD)Llama-2 7B10.1427.3912.6631.367.1525.22
Ours (FT+ICD)Mistral-v0.1 7B12.4231.5714.5635.568.3827.29

Fine-tuned models with ICD loss significantly outperform all pre-trained baselines. Mistral-v0.1 7B FT is the best open-source model across all three datasets.


๐Ÿ“š Citation

@inproceedings{ahad2024empowering,
  title={Empowering Meta-analysis: Leveraging Large Language Models for Scientific Synthesis},
  author={Ahad, Jawad Ibn and Sultan, Rafeed Mohammad and Kaikobad, Abraham and Rahman, Fuad and Amin, Mohammad Ruhul and Mohammed, Nabeel and Rahman, Shafin},
  booktitle={IEEE International Conference on Big Data (BigData)},
  pages={},
  year={2024},
  doi={10.1109/BigData62323.2024.10825310}
}