Modèle 4B open-source rivalise GPT-5.6 Sol à 100x moins cher
Original : Beating GPT-5.6 Sol on retrieval with 100x cheaper open models
Pourquoi c'est important
Démontre que le RL post-training peut rendre les petits modèles open-source compétitifs face aux API frontier à grande échelle.
Castform et Neon ont entraîné un modèle open-source de 4 milliards de paramètres atteignant la précision de GPT-5.6 Sol en recherche documentaire, pour un coût 100 fois inférieur, grâce au RL post-training et à Lakebase Postgres.
Castform et Neon ont publié un retour d'expérience détaillant comment un modèle open-source de 4B paramètres, post-entraîné par reinforcement learning (RL), rivalise avec GPT-5.6 Sol sur les tâches de retrieval, tout en coûtant environ 100 fois moins cher. Une requête multi-tour typique avec gpt-5.6-sol dépasse 10 secondes et coûte ~0,03 $ end-to-end, ce qui devient prohibitif à l'échelle. Face à ce constat, les deux startups ont combiné leur infrastructure : Neon fournit le stockage des documents dans Postgres via Lakebase Search (extensions lakebase_text et lakebase_vector), tandis que Castform orchestre la génération de données synthétiques et le RL post-training. Selon Ying Hang Seah, cofondateur de Castform : « La meilleure donnée d'entraînement des équipes se trouve déjà dans leurs bases de données. Le problème, c'est de la rendre exploitable. » L'objectif déclaré est de rendre le post-training aussi accessible que le prompt engineering, sans nécessiter d'expertise en machine learning ou en gestion de GPU. Cette approche s'inscrit dans la tendance des workflows de retrieval agentique multi-hop, qui ont remplacé les pipelines RAG statiques à partir de 2025.