Università di Genova logo, link al sitoUniRe logo, link alla pagina iniziale
    • English
    • italiano
  • italiano 
    • English
    • italiano
  • Login
Mostra Item 
  •   Home
  • Tesi
  • Tesi di Laurea
  • Laurea Magistrale
  • Mostra Item
  •   Home
  • Tesi
  • Tesi di Laurea
  • Laurea Magistrale
  • Mostra Item
JavaScript is disabled for your browser. Some features of this site may not work without it.

Ottimizzazione dei parametri dei Large Language Models (LLM) per la valutazione della qualità dei requisiti: prestazioni, affidabilità e coerenza.

Mostra/Apri
tesi38091953.pdf (832.5Kb)
Autore
Magilaj, Uendi <2002>
Zhuka, Darla <2002>
Data
2026-09-03
Disponibile dal
2026-09-10
Abstract
I Large Language Models (LLM) hanno suscitato un notevole interesse nell'ambito della Requirements Engineering, grazie alla loro capacità di svolgere attività quali la valutazione della qualità dei requisiti e l'individuazione di difetti. Tuttavia, la qualità e la coerenza delle risposte generate dipendono da diversi parametri di inferenza, in particolare dal valore della temperatura. Sebbene la temperatura abbia un effetto diretto sul comportamento del modello, essa viene generalmente scelta sulla base di valori fissi o empirici, senza che il suo impatto sulle prestazioni della valutazione sia stato analizzato in modo sistematico. La presente tesi analizza l'influenza della temperatura sulla qualità della valutazione dei requisiti effettuata mediante Large Language Models. Gli esperimenti sono condotti su diversi dataset contenenti requisiti ingegneristici provenienti da vari domini. Ogni requisito viene valutato secondo un insieme di criteri di qualità predefiniti e le valutazioni generate vengono successivamente confrontate con classificazioni di riferimento definite manualmente. Al fine di valutare la stabilità delle classificazioni del modello, gli esperimenti vengono ripetuti più volte per ciascun valore di temperatura, consentendo così di analizzarne la ripetibilità. Vengono studiati e confrontati due metodi per la selezione del valore di temperatura: Grid Search e Multi-Objective Bayesian Optimisation. I due approcci vengono valutati sia in termini di qualità delle configurazioni individuate sia in termini del numero di valutazioni richieste. Viene inoltre condotta un'analisi statistica per determinare se le differenze osservate tra le configurazioni possano essere distinte dalla variabilità intrinseca del processo di valutazione. Il principale contributo dello studio è di natura metodologica. I risultati mostrano che l'effetto di un parametro di generazione sulle prestazioni della valutazione può essere inferiore alla variabilità tra esecuzioni successive d
 
Large Language Models (LLMs) have drawn a great deal of attention when it comes to use in Requirements Engineering because of their capability to carry out tasks like assessing requirements quality and detecting defects. Yet the quality and consistency of the responses they give depend on a number of inference parameters, especially the temperature setting. Even though the temperature has a direct effect on the model’s behaviour, it is usually chosen by means of fixed or empirical values without there having been a systematic study of its effect on assessment performance. The thesis looks at how temperature affects the quality of requirements assessments carried out using large language models. The experiments are carried out on a number of datasets which include engineering requirements from several domains. Each requirement is assessed according to a set of predefined quality criteria, and the assessments generated are then compared with manually established reference classifications. In order to assess the stability of the model’s classifications, the experiments are repeated multiple times for each temperature setting, enabling an analysis of their repeatability. Two methods for choosing the temperature value are studied and compared, namely Grid Search and Multi-Objective Bayesian Optimisation. The two approaches are assessed in terms of the quality of the configurations they identify and the number of evaluations they require, and statistical analysis is carried out in order to establish whether the differences observed between configurations can be distinguished from the variability of the assessment process itself. The principal contribution of the study is methodological. It shows that the effect of a generation parameter on assessment performance can be smaller than the run-to-run variability of the system itself, and that comparisons based on a small number of executions per configuration are therefore unable to distinguish a genuine effect from stochasti
 
Tipo
info:eu-repo/semantics/masterThesis
Collezioni
  • Laurea Magistrale [8051]
URI
https://unire.unige.it/handle/123456789/16741
Metadati
Mostra tutti i dati dell'item

UniRe - Università degli studi di Genova | Informazioni e Supporto
 

 

UniReArchivi & Collezioni

Area personale

Login

UniRe - Università degli studi di Genova | Informazioni e Supporto