[text-clustering] add an abstract for each cluster - #477
Conversation
parmentf
left a comment
There was a problem hiding this comment.
Les deux problèmes de correction (division par zéro et p=0) doivent être résolus avant merge. Le reste est mélioratif mais ne bloque pas.
Le changement est globalement bien structuré : le nouveau format objet title/abstract est propagé de manière cohérente à tous les points de consommation, et la validation LLM est renforcée. Les bugs identifiés sont des cas limites de taille de cluster.
| parsed_answer = json.loads(answer) | ||
|
|
||
| # Vérifie que toutes les clés attendues sont présentes | ||
| if set(parsed_answer.keys()) != expected_keys: |
There was a problem hiding this comment.
🚨 issue: Risque de faux négatifs
Cette comparaison ignore l'ordre (correct) mais rejette toute clé supplémentaire. Or le schéma JSON a additionalProperties=False côté client, mais le LLM peut parfois rajouter des champs. La double validation (schema strict + set check) est redondante et la vérification set() peut rejeter des réponses valides si le LLM ajoute un champ mineur.
FYI : à considérer si on veut une validation "superset" plutôt que stricte.
| except Exception: | ||
| pass | ||
|
|
||
| # Add top docs to dictonary |
There was a problem hiding this comment.
✒️ typo:
| # Add top docs to dictonary | |
| # Add top docs to dictionary |
and fixed an error in Noise detect
No description provided.